Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment Bo Li, Chaowei Xiao, Jiazhao Li, Jiongxiao Wang Published: 2024-02-22Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 30 |
| Stop Reasoning! When Multimodal LLMs with Chain-of-Thought Reasoning Meets Adversarial Images Fan Xue, Jindong Gu, Philip Torr, Shuo Chen Published: 2024-02-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 24 |
| Explorations of Self-Repair in Language Models Cody Rushing, Neel Nanda Published: 2024-02-23Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 20 |
| Fast Adversarial Attacks on Language Models In One GPU Minute Atoosa Chegini, Gaurang Sriramanan, Priyatham Kattakinda, Shoumik Saha Published: 2024-02-23Area: Adversarial RobustnessCitations: 75 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 75 |
| How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries Animesh Mukherjee, Rima Hazra, Sayan Layek, Somnath Banerjee Published: 2024-02-23Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 32 |
| Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology Baosheng Wang, Enze Wang, Francis Song, Kai Chen Published: 2024-02-24Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 27 |
| LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper Daoyuan Wu, Ning Liu, Shuai Wang, Yang Liu Published: 2024-02-24Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, position | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 11 |
| Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing Alexander Robey, Bairu Hou, Eric Wong, George J. Pappas Published: 2024-02-25Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 73 |
| Evaluating Robustness of Generative Search Engine on Adversarial Factoid Questions Junzhe Chen, Lijie Wen, Philip S. Yu, Qun Liu Published: 2024-02-25Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (96%) | 9 |
| Eight Methods to Evaluate Robust Unlearning in LLMs Aengus Lynch, Aidan Ewart, Dylan Hadfield-Menell, Phillip Guo Published: 2024-02-26Area: Safety EvaluationCitations: 124 Tags: ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 124 |
| Immunization against harmful fine-tuning attacks Domenic Rosati, Frank Rudzicz, Hassan Sajjad, Jan Batzner Published: 2024-02-26Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, theoretical | 2024-02-26 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E4 / R2 (97%) | 34 |
| Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder Published: 2024-02-26Area: Safety EvaluationCitations: 160 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | 160 |
| ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors Di Zhang, Hao Sun, Hongning Wang, Jingyuan Ma Published: 2024-02-26Area: Safety EvaluationCitations: 49 Tags: ai-safety, safety-evaluation, tool | 2024-02-26 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 49 |
| Information Flow Routes: Automatically Interpreting Language Models at Scale Elena Voita, Javier Ferrando Published: 2024-02-27Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 74 |
| RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations Atticus Geiger, Christopher Potts, Jing Huang, Mor Geva Published: 2024-02-27Area: Safety EvaluationCitations: 61 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-27 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E4 / R3 (98%) | 61 |
| SoFA: Shielded On-the-fly Alignment via Priority Rule Following Bowen Yu, Haiyang Yu, Hongyu Lin, Le Sun Published: 2024-02-27Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-02-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 18 |
| Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue Haopeng Chen, Jiuyang Xiang, Quan Liu, Sen Su Published: 2024-02-27Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 61 |
| When Your AIs Deceive You: Challenges with Partial Observability of Human Evaluators in Reward Learning Anca Dragan, Davis Foote, Erik Jenner, Leon Lang Published: 2024-02-27Area: Deception & FailureCitations: 13 Tags: ai-safety, deception-failure, theoretical | 2024-02-27 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | 13 |
| Exploring Advanced Methodologies in Security Evaluation for LLMs Jiawei Zhang, Jun Huang, Qi Wang, Weihong Han Published: 2024-02-28Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, survey | 2024-02-28 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R3 (93%) | - |
| Exploring Multilingual Concepts of Human Values in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages? Deyi Xiong, Shaoyang Xu, Weilong Dong, Xinwei Wu Published: 2024-02-28Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-02-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 18 |
| How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning Joykirat Singh, Soumen Chakrabarti, Subhabrata Dutta, Tanmoy Chakraborty Published: 2024-02-28Area: Mechanistic Interp.Citations: 54 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 54 |
| Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates Anirudh Goyal, Dingli Yu, Haoyu Zhao, Kaifeng Lyu Published: 2024-02-28Area: Alignment TrainingCitations: 92 Tags: ai-safety, alignment-training, empirical | 2024-02-28 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 92 |
| Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction Guozhu Meng, Kai Chen, Tong Liu, Yingjie Zhang Published: 2024-02-28Area: Adversarial RobustnessCitations: 110 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 110 |
| AtP*: An efficient and scalable method for localizing LLM behaviour to components J谩nos Kram谩r, Neel Nanda, Rohin Shah, Tom Lieberum Published: 2024-03-01Area: Mechanistic Interp.Citations: 71 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 71 |
| Enhancing Jailbreak Attacks with Diversity Guidance Dinghao Jing, Xiaojun Wan, Xu Zhang Published: 2024-03-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2024-03-01Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 61 |
| Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling Anirudh Goyal, Kenji Kawaguchi, Michael Shieh, Tianle Cai Published: 2024-03-02Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R5 (95%) | 31 |
| AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks Huazheng Wang, Qingyun Wu, Xiao Zhang, Yifan Zeng Published: 2024-03-02Area: Adversarial RobustnessCitations: 137 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 137 |
| Dissecting Language Models: Machine Unlearning via Selective Pruning Nandi Schoots, Nicholas Pochinkov Published: 2024-03-02Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2024-03-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 34 |
| Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models Aman Chadha, Arijit Ghosh Chowdhury, Faysal Hossain Shezan, Md Mofijul Islam Published: 2024-03-03Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, survey | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (94%) | 47 |