Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization Kai Chen, Kai Hu, Lijun Yu, Matt Fredrikson Published: 2024-05-15Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| Adversarial Robustness for Visual Grounding of Multimodal Large Language Models Jiawang Bai, Kuofeng Gao, Shu-Tao Xia, Yang Bai Published: 2024-05-16Area: Multimodal SafetyCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (93%) | 26 |
| Human-AI Safety: A Descendant of Generative AI and Control Systems Safety Andrea Bajcsy, Jaime F. Fisac Published: 2024-05-16Area: Formal/TheoreticalCitations: 9 Tags: ai-safety, formaltheoretical, theoretical | 2024-05-16 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R4 (93%) | 9 |
| Learnable Privacy Neurons Localization in Language Models Ruizhe Chen, Tianxiang Hu, Yang Feng, Zuozhu Liu Published: 2024-05-16Area: Mechanistic Interp.Citations: 30 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-05-16 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 30 |
| Identifying Functionally Important Features with End-to-End Sparse Dictionary Learning Dan Braun, Jordan Taylor, Lee Sharkey, Nicholas Goldowsky-Dill Published: 2024-05-17Area: Mechanistic Interp.Citations: 57 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 57 |
| Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors Changsheng Wang, Chaowei Xiao, Jiachen Sun, Jiongxiao Wang Published: 2024-05-17Area: Multimodal SafetyCitations: 16 Tags: ai-safety, empirical, multimodal-safety | 2024-05-17 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 16 |
| The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks Avery Griffin, Dan Braun, Jake Mendel, J枚rn St枚hler Published: 2024-05-17Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (93%) | 6 |
| Using Degeneracy in the Loss Landscape for Mechanistic Interpretability Cindy Wu, Dan Braun, Jake Mendel, Kaarel H盲nni Published: 2024-05-17Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2024-05-17 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (95%) | 11 |
| Hummer: Towards Limited Competitive Preference Dataset Jingqing Ruan, Junwu Xiong, Jun Zhou, Li Jiang Published: 2024-05-19Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, dataset | 2024-05-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, dataset | E6 / R3 (96%) | 10 |
| Lockpicking LLMs: A Logit-Based Jailbreak Using Token-level Manipulation Gelei Deng, Kailong Wang, Ling Shi, Shengquan Chen Published: 2024-05-20Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Sparse Autoencoders Enable Scalable and Reliable Circuit Identification in Language Models Charles O'Neill, Thang Bui Published: 2024-05-21Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-21 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 11 |
| Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming Jianhong Wang, Jiaxu Liu, Meng Fang, Sihao Wu Published: 2024-05-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Automatically Identifying Local and Global Circuits with Linear Computation Graphs Fukang Zhu, Junxuan Wang, Wentao Shu, Xipeng Qiu Published: 2024-05-22Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 20 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| LIRE: Listwise Reward Enhancement for Preference Alignment Junbo Guo, Lei Zhang, Mingye Zhu, Yi Liu Published: 2024-05-22Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, empirical | 2024-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity Apratim Dey, Junjie Hu, Rheeya Uppaal, Yiqiao Zhong Published: 2024-05-22Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 21 |
| Safety Alignment for Vision Language Models Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-05-22Area: Multimodal SafetyCitations: 20 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 20 |
| TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models Gongshen Liu, Pengzhou Cheng, Ping Yi, Tianjie Ju Published: 2024-05-22Area: Adversarial RobustnessCitations: 56 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 56 |
| ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation An Zhang, Han Wang, Jingnan Zheng, Jun Sun Published: 2024-05-23Area: Safety EvaluationCitations: 48 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R4 (95%) | 48 |
| Lessons from the Trenches on Reproducible Evaluation of Language Models Alham Fikri Aji, Andy Zou, Anthony DiPofi, Aviya Skowron Published: 2024-05-23Area: Safety EvaluationCitations: 119 Tags: ai-safety, safety-evaluation, tool | 2024-05-23 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R2 (96%) | 119 |
| MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability Bing Qin, Danyang Zhao, Dongliang Xu, Liangyu Huo Published: 2024-05-23Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 15 |
| Not All Language Model Features Are Linear Eric J. Michaud, Isaac Liao, Joshua Engels, Max Tegmark Published: 2024-05-23Area: Mechanistic Interp.Citations: 106 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | 106 |
| Representation Noising: A Defence Mechanism Against Harmful Finetuning Carsten Maple, David Atanasov, Domenic Rosati, Frank Rudzicz Published: 2024-05-23Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (94%) | 66 |
| S-Eval: Automatic and Adaptive Test Generation for Benchmarking Safety Evaluation of Large Language Models Dongxia Wang, Hui Xue, Jinfeng Li, Jingyi Wang Published: 2024-05-23Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R5 (98%) | 21 |
| SimPO: Simple Preference Optimization with a Reference-Free Reward Danqi Chen, Mengzhou Xia, Yu Meng Published: 2024-05-23Area: Alignment TrainingCitations: 850 Tags: ai-safety, alignment-training, empirical | 2024-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 850 |
| Efficient Adversarial Training in LLMs with Continuous Attacks Alessandro Sordoni, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-05-24Area: Adversarial RobustnessCitations: 103 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (100%) | 103 |
| A statistical framework for weak-to-strong generalization Felipe Maia Polo, Mikhail Yurochkin, Moulinath Banerjee, Seamus Somerstep Published: 2024-05-25Area: Scalable OversightCitations: 8 Tags: ai-safety, scalable-oversight, theoretical | 2024-05-25 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (95%) | 8 |
| No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks Chak Tou Leong, Hanlin Wang, Jian Wang, Kaishuai Xu Published: 2024-05-25Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 31 |
| Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character Bo Li, Chaowei Xiao, Muhao Chen, Siyuan Ma Published: 2024-05-25Area: Multimodal SafetyCitations: 59 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 59 |