Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Corrective Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2024-02-21Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 23 |
| Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment Adian Liusie, Mark Gales, Vyas Raina Published: 2024-02-21Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 104 |
| Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content Federico Bianchi, James Zou Published: 2024-02-21Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Learning to Poison Large Language Models During Instruction Tuning Dongxiao Zhu, Douglas Zytko, Mohammad Amin Roshani, Saleh Zare Zade Published: 2024-02-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| LLM Jailbreak Attack versus Defense Techniques -- A Comprehensive Study Gelei Deng, Stjepan Picek, Yi Liu, Yuekang Li Published: 2024-02-21Area: Adversarial RobustnessCitations: 98 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 98 |
| Chain-of-Thought Unfaithfulness as Disguised Accuracy Ana Marasovi膰, Nathan Stringham, Oliver Bentham Published: 2024-02-22Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-02-22 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 25 |
| Fine-tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking David Bau, Nikhil Prakash, Tal Haklay, Tamar Rott Shaham Published: 2024-02-22Area: Training DynamicsCitations: 101 Tags: ai-safety, empirical, training-dynamics | 2024-02-22 | Training Dynamics | ai-safety, empirical, training-dynamics | E7 / R4 (95%) | 101 |
| Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment Bo Li, Chaowei Xiao, Jiazhao Li, Jiongxiao Wang Published: 2024-02-22Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 30 |
| Stop Reasoning! When Multimodal LLMs with Chain-of-Thought Reasoning Meets Adversarial Images Fan Xue, Jindong Gu, Philip Torr, Shuo Chen Published: 2024-02-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 24 |
| Explorations of Self-Repair in Language Models Cody Rushing, Neel Nanda Published: 2024-02-23Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 20 |
| Fast Adversarial Attacks on Language Models In One GPU Minute Atoosa Chegini, Gaurang Sriramanan, Priyatham Kattakinda, Shoumik Saha Published: 2024-02-23Area: Adversarial RobustnessCitations: 75 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 75 |
| How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries Animesh Mukherjee, Rima Hazra, Sayan Layek, Somnath Banerjee Published: 2024-02-23Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 32 |
| Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology Baosheng Wang, Enze Wang, Francis Song, Kai Chen Published: 2024-02-24Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 27 |
| Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing Alexander Robey, Bairu Hou, Eric Wong, George J. Pappas Published: 2024-02-25Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 73 |
| Eight Methods to Evaluate Robust Unlearning in LLMs Aengus Lynch, Aidan Ewart, Dylan Hadfield-Menell, Phillip Guo Published: 2024-02-26Area: Safety EvaluationCitations: 124 Tags: ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 124 |
| Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder Published: 2024-02-26Area: Safety EvaluationCitations: 160 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | 160 |
| Information Flow Routes: Automatically Interpreting Language Models at Scale Elena Voita, Javier Ferrando Published: 2024-02-27Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 74 |
| SoFA: Shielded On-the-fly Alignment via Priority Rule Following Bowen Yu, Haiyang Yu, Hongyu Lin, Le Sun Published: 2024-02-27Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-02-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 18 |
| Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue Haopeng Chen, Jiuyang Xiang, Quan Liu, Sen Su Published: 2024-02-27Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 61 |
| Exploring Multilingual Concepts of Human Values in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages? Deyi Xiong, Shaoyang Xu, Weilong Dong, Xinwei Wu Published: 2024-02-28Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-02-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 18 |
| How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning Joykirat Singh, Soumen Chakrabarti, Subhabrata Dutta, Tanmoy Chakraborty Published: 2024-02-28Area: Mechanistic Interp.Citations: 54 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 54 |
| Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates Anirudh Goyal, Dingli Yu, Haoyu Zhao, Kaifeng Lyu Published: 2024-02-28Area: Alignment TrainingCitations: 92 Tags: ai-safety, alignment-training, empirical | 2024-02-28 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 92 |
| Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction Guozhu Meng, Kai Chen, Tong Liu, Yingjie Zhang Published: 2024-02-28Area: Adversarial RobustnessCitations: 110 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 110 |
| AtP*: An efficient and scalable method for localizing LLM behaviour to components J谩nos Kram谩r, Neel Nanda, Rohin Shah, Tom Lieberum Published: 2024-03-01Area: Mechanistic Interp.Citations: 71 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 71 |
| Enhancing Jailbreak Attacks with Diversity Guidance Dinghao Jing, Xiaojun Wan, Xu Zhang Published: 2024-03-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2024-03-01Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 61 |
| Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling Anirudh Goyal, Kenji Kawaguchi, Michael Shieh, Tianle Cai Published: 2024-03-02Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R5 (95%) | 31 |
| AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks Huazheng Wang, Qingyun Wu, Xiao Zhang, Yifan Zeng Published: 2024-03-02Area: Adversarial RobustnessCitations: 137 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 137 |
| Dissecting Language Models: Machine Unlearning via Selective Pruning Nandi Schoots, Nicholas Pochinkov Published: 2024-03-02Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2024-03-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 34 |
| GuardT2I: Defending Text-to-Image Models from Adversarial Prompts Jianyuan Zhong, Qiang Xu, Ruiyuan Gao, Xiao Yang Published: 2024-03-03Area: Adversarial RobustnessCitations: 51 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 51 |