Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner Daoyuan Wu, Juergen Rahmel, Ning Liu, Pingchuan Ma Published: 2024-06-08Area: Adversarial RobustnessCitations: 39 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 39 |
| Machine Against the RAG: Jamming Retrieval-Augmented Generation with Blocker Documents Avital Shafran, Roei Schuster, Vitaly Shmatikov Published: 2024-06-09Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 68 |
| Aligning Large Language Models with Representation Editing: A Control Perspective Chao Zhang, Haorui Wang, Kai Wang, Lingkai Kong Published: 2024-06-10Area: Model EditingCitations: 49 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 49 |
| Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models Chen Wu, Jiaqi Wang, Renze Lou, Xi Li Published: 2024-06-10Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 21 |
| Language Models Resist Alignment Boyuan Chen, Changye Li, Hantao Lou, Jiaming Ji Published: 2024-06-10Area: Alignment TrainingCitations: 20 Tags: ai-safety, alignment-training, empirical | 2024-06-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 20 |
| Safety Alignment Should Be Made More Than Just a Few Tokens Deep Ahmad Beirami, Ashwinee Panda, Kaifeng Lyu, Peter Henderson Published: 2024-06-10Area: Adversarial RobustnessCitations: 315 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 315 |
| The Curse of Popularity: Popular Entities have Catastrophic Side Effects when Deleting Knowledge from Language Models Benjamin Heinzerling, Go Kamoda, Keisuke Sakaguchi, Kentaro Inui Published: 2024-06-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| AI Sandbagging: Language Models can Strategically Underperform on Evaluations Felix Hofst脙陇tter, Francis Rhys Ward, Oliver Jaffe, Samuel F. Brown Published: 2024-06-11Area: Deception & FailureCitations: 70 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-06-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 70 |
| Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets Bowen Qin, Chen Huang, Duanyu Feng, Wenqiang Lei Published: 2024-06-12Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-06-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Security of AI Agents Ethan Wang, Hao Chen, Yifeng He, Yuyang Rong Published: 2024-06-12Area: Agent SafetyCitations: 21 Tags: agent-safety, ai-safety, empirical | 2024-06-12 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (94%) | 21 |
| GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning Bo Li, Carl Yang, Chulin Xie, Dawn Song Published: 2024-06-13Area: Agent SafetyCitations: 69 Tags: agent-safety, ai-safety, empirical | 2024-06-13 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (97%) | 69 |
| REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space Martin Tutek, Tomer Ashuach, Yonatan Belinkov Published: 2024-06-13Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs Lu Yan, Wenbo Guo, Xiangyu Zhang, Xuan Chen Published: 2024-06-13Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 20 |
| Talking Heads: Understanding Inter-layer Communication in Transformer Language Models Carsten Eickhoff, Ellie Pavlick, Jack Merullo Published: 2024-06-13Area: Mechanistic Interp.Citations: 36 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-13 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 36 |
| Towards Effective Evaluations and Comparisons for LLM Unlearning Methods Bo Han, Jianing Zhu, Masashi Sugiyama, Puning Yang Published: 2024-06-13Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 24 |
| Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models Frauke Kreuter, Nina Rimsky, Sarah Ball Published: 2024-06-13Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (92%) | 30 |
| When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search Wenbo Guo, Xiangyu Zhang, Xuan Chen, Yuzhou Nie Published: 2024-06-13Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 47 |
| Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs Abhimanyu Hans, Abhinav Bhatele, Gowthami Somepalli, Hamid Kazemi Published: 2024-06-14Area: Model EditingCitations: 54 Tags: ai-safety, empirical, model-editing | 2024-06-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 54 |
| Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models Alex Tamkin, Buck Shlegeris, Carson Denison, David Duvenaud Published: 2024-06-14Area: Deception & FailureCitations: 86 Tags: ai-safety, deception-failure, empirical | 2024-06-14 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 86 |
| On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models Chirag Agarwal, Dan Ley, Himabindu Lakkaraju, Sree Harsha Tanneru Published: 2024-06-15Area: Deception & FailureCitations: 20 Tags: ai-safety, deception-failure, empirical | 2024-06-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (93%) | 20 |
| Avoiding Copyright Infringement via Large Language Model Unlearning Eric Wong, Guangyao Dou, Kaize Ding, Qing Lyu Published: 2024-06-16Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 20 |
| Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis Han Xu, Hui Liu, Jiliang Tang, Makoto Yamada Published: 2024-06-16Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (94%) | 49 |
| Compact Proofs of Model Performance via Mechanistic Interpretability Alex Gibson, Chun Hei Yip, Euan Ong, Jason Gross Published: 2024-06-17Area: Formal/TheoreticalCitations: 12 Tags: ai-safety, empirical, formaltheoretical, interpretability | 2024-06-17 | Formal/Theoretical | ai-safety, empirical, formaltheoretical, interpretability | E4 / R3 (92%) | 12 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| Is poisoning a real threat to LLM alignment? Maybe more so than you think Furong Huang, Pankayaraj Pathmanathan, Souradip Chakraborty, Xiangyu Liu Published: 2024-06-17Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (95%) | 28 |
| Refusal in Language Models Is Mediated by a Single Direction Aaquib Syed, Andy Arditi, Daniel Paleka, Neel Nanda Published: 2024-06-17Area: Representation AnalysisCitations: 481 Tags: ai-safety, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (98%) | 481 |
| Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations Rima Hazra, Sayan Layek, Somnath Banerjee, Soujanya Poria Published: 2024-06-17Area: Model EditingCitations: 26 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 26 |
| Soft Prompting for Unlearning in Large Language Models Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2024-06-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs Dennis Wei, Farhan Ahmed, Inkit Padhi, Nathalie Baracaldo Published: 2024-06-17Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 20 |
| STAR: SocioTechnical Approach to Red Teaming Language Models Bernat Guill茅n Pegueroles, Canfer Akbulut, John Mellor, Kristian Lum Published: 2024-06-17Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-06-17 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 16 |