Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative Chengshuai Zhao, Huan Liu, Raha Moraffah, Tianlong Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 21 |
| Coercing LLMs to do and reveal (almost) anything Alex Stein, Jonas Geiping, Khalid Saifullah, Manli Shu Published: 2024-02-21Area: Adversarial RobustnessCitations: 86 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 86 |
| Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment Adian Liusie, Mark Gales, Vyas Raina Published: 2024-02-21Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 104 |
| Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content Federico Bianchi, James Zou Published: 2024-02-21Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Learning to Poison Large Language Models During Instruction Tuning Dongxiao Zhu, Douglas Zytko, Mohammad Amin Roshani, Saleh Zare Zade Published: 2024-02-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| LLM Jailbreak Attack versus Defense Techniques -- A Comprehensive Study Gelei Deng, Stjepan Picek, Yi Liu, Yuekang Li Published: 2024-02-21Area: Adversarial RobustnessCitations: 98 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 98 |
| Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment Bo Li, Chaowei Xiao, Jiazhao Li, Jiongxiao Wang Published: 2024-02-22Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 30 |
| Stop Reasoning! When Multimodal LLMs with Chain-of-Thought Reasoning Meets Adversarial Images Fan Xue, Jindong Gu, Philip Torr, Shuo Chen Published: 2024-02-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 24 |
| Fast Adversarial Attacks on Language Models In One GPU Minute Atoosa Chegini, Gaurang Sriramanan, Priyatham Kattakinda, Shoumik Saha Published: 2024-02-23Area: Adversarial RobustnessCitations: 75 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 75 |
| How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries Animesh Mukherjee, Rima Hazra, Sayan Layek, Somnath Banerjee Published: 2024-02-23Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 32 |
| Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology Baosheng Wang, Enze Wang, Francis Song, Kai Chen Published: 2024-02-24Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 27 |
| LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper Daoyuan Wu, Ning Liu, Shuai Wang, Yang Liu Published: 2024-02-24Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, position | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 11 |
| Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing Alexander Robey, Bairu Hou, Eric Wong, George J. Pappas Published: 2024-02-25Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 73 |
| Evaluating Robustness of Generative Search Engine on Adversarial Factoid Questions Junzhe Chen, Lijie Wen, Philip S. Yu, Qun Liu Published: 2024-02-25Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (96%) | 9 |
| Immunization against harmful fine-tuning attacks Domenic Rosati, Frank Rudzicz, Hassan Sajjad, Jan Batzner Published: 2024-02-26Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, theoretical | 2024-02-26 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E4 / R2 (97%) | 34 |
| Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder Published: 2024-02-26Area: Safety EvaluationCitations: 160 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | 160 |
| Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue Haopeng Chen, Jiuyang Xiang, Quan Liu, Sen Su Published: 2024-02-27Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 61 |
| Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction Guozhu Meng, Kai Chen, Tong Liu, Yingjie Zhang Published: 2024-02-28Area: Adversarial RobustnessCitations: 110 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 110 |
| Enhancing Jailbreak Attacks with Diversity Guidance Dinghao Jing, Xiaojun Wan, Xu Zhang Published: 2024-03-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2024-03-01Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 61 |
| Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling Anirudh Goyal, Kenji Kawaguchi, Michael Shieh, Tianle Cai Published: 2024-03-02Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R5 (95%) | 31 |
| AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks Huazheng Wang, Qingyun Wu, Xiao Zhang, Yifan Zeng Published: 2024-03-02Area: Adversarial RobustnessCitations: 137 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 137 |
| Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models Aman Chadha, Arijit Ghosh Chowdhury, Faysal Hossain Shezan, Md Mofijul Islam Published: 2024-03-03Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, survey | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (94%) | 47 |
| GuardT2I: Defending Text-to-Image Models from Adversarial Prompts Jianyuan Zhong, Qiang Xu, Ruiyuan Gao, Xiao Yang Published: 2024-03-03Area: Adversarial RobustnessCitations: 51 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 51 |
| Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications Ben Nassi, Ron Bitton, Stav Cohen Published: 2024-03-05Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 43 |
| Latent Adversarial Training Dylan Hadfield-Menell, Lennart Schulze, Oam Patel, Stephen Casper Published: 2024-03-08Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 66 |
| Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation Hongning Wang, Jean-Fran莽ois Ton, Wei Shen, Xiaoying Zhang Published: 2024-03-08Area: Alignment TrainingCitations: 23 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 23 |
| Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations Aashka Trivedi, Adriana Alvarado Garcia, Ambrish Rawat, Ateret Anaby-Tavor Published: 2024-03-09Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, tool | 2024-03-09 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (99%) | 15 |
| Can LLMs Separate Instructions From Data? And What Do We Even Mean By That? Christoph H. Lampert, Egor Zverev, Mario Fritz, Sahar Abdelnabi Published: 2024-03-11Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, benchmark | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E4 / R3 (96%) | 50 |
| Stealing Part of a Production Language Model A. Feder Cooper, Arthur Conmy, Daniel Paleka, David Rolnick Published: 2024-03-11Area: Adversarial RobustnessCitations: 147 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 147 |