Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Compact Proofs of Model Performance via Mechanistic Interpretability Alex Gibson, Chun Hei Yip, Euan Ong, Jason Gross Published: 2024-06-17Area: Formal/TheoreticalCitations: 12 Tags: ai-safety, empirical, formaltheoretical, interpretability | 2024-06-17 | Formal/Theoretical | ai-safety, empirical, formaltheoretical, interpretability | E4 / R3 (92%) | 12 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| Is poisoning a real threat to LLM alignment? Maybe more so than you think Furong Huang, Pankayaraj Pathmanathan, Souradip Chakraborty, Xiangyu Liu Published: 2024-06-17Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (95%) | 28 |
| Refusal in Language Models Is Mediated by a Single Direction Aaquib Syed, Andy Arditi, Daniel Paleka, Neel Nanda Published: 2024-06-17Area: Representation AnalysisCitations: 481 Tags: ai-safety, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (98%) | 481 |
| Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations Rima Hazra, Sayan Layek, Somnath Banerjee, Soujanya Poria Published: 2024-06-17Area: Model EditingCitations: 26 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 26 |
| Soft Prompting for Unlearning in Large Language Models Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2024-06-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models Feng Zhao, Guodong Zheng, Jing Shao, Jinlan Fu Published: 2024-06-17Area: Multimodal SafetyCitations: 68 Tags: ai-safety, alignment-training, dataset, multimodal-safety | 2024-06-17 | Multimodal Safety | ai-safety, alignment-training, dataset, multimodal-safety | E6 / R3 (95%) | 68 |
| Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs Dennis Wei, Farhan Ahmed, Inkit Padhi, Nathalie Baracaldo Published: 2024-06-17Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 20 |
| STAR: SocioTechnical Approach to Red Teaming Language Models Bernat Guill茅n Pegueroles, Canfer Akbulut, John Mellor, Kristian Lum Published: 2024-06-17Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-06-17 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 16 |
| Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization Guangyao Shen, Shiqi Shen, Wenkai Yang, Yankai Lin Published: 2024-06-17Area: Scalable OversightCitations: 20 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-06-17 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E6 / R3 (92%) | 20 |
| Transcoders Find Interpretable LLM Feature Circuits Jacob Dunefsky, Neel Nanda, Philippe Chlenski Published: 2024-06-17Area: Mechanistic Interp.Citations: 102 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-06-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 102 |
| Who's Asking? User Personas and the Mechanics of Latent Misalignment Ann Yuan, Asma Ghandeharioun, Emily Reif, Lucas Dixon Published: 2024-06-17Area: Representation AnalysisCitations: 23 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R4 (95%) | 23 |
| Dissecting Adversarial Robustness of Multimodal LM Agents Aditi Raghunathan, Chen Henry Wu, Daniel Fried, Jing Yu Koh Published: 2024-06-18Area: Adversarial RobustnessCitations: 84 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 84 |
| Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries Amir Globerson, Daniela Gottesman, Eden Biran, Mor Geva Published: 2024-06-18Area: Mechanistic Interp.Citations: 75 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | 75 |
| SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models Animesh Mukherjee, Rima Hazra, Sayan Layek, Shanu Kumar Published: 2024-06-18Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 14 |
| SNAP: Unlearning Selective Knowledge in Large Language Models with Negative Instructions Daniel Rim, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-06-18Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 7 |
| Stealth edits for provably fixing or attacking large language models Alexander Bastounis, Alexander N. Gorban, Desmond J. Higham, Ivan Y. Tyukin Published: 2024-06-18Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 2 |
| AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents Edoardo Debenedetti, Florian Tramer, Jie Zhang, Luca Beurer-Kellner Published: 2024-06-19Area: Agent SafetyCitations: 94 Tags: agent-safety, ai-safety, benchmark | 2024-06-19 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 94 |
| BeHonest: Benchmarking Honesty in Large Language Models Binjie Wang, Ethan Chern, Jiahe Jin, Pengfei Liu Published: 2024-06-19Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 12 |
| Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data Beth Goldberg, Iason Gabriel, Nahema Marchal, Rachel Xu Published: 2024-06-19Area: Safety EvaluationCitations: 37 Tags: ai-safety, safety-evaluation, survey | 2024-06-19 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (96%) | 37 |
| Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings Bingda Tang, Dongping Chen, Jingyu Tang, Lichao Sun Published: 2024-06-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 7 |
| Textual Unlearning Gives a False Sense of Unlearning Jiacheng Du, Jiahui Hu, Jie Zhang, Kui Ren Published: 2024-06-19Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | 9 |
| Towards Minimal Targeted Updates of Language Models with Targeted Negative Training Arya Tafvizi, Lily H. Zhang, Rajesh Ranganath Published: 2024-06-19Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2024-06-19 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (93%) | 1 |
| Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning Shengyuan Hu, Virginia Smith, Yiwei Fu, Zhiwei Steven Wu Published: 2024-06-19Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 40 |
| Adversaries Can Misuse Combinations of Safe Models Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2024-06-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 21 |
| Connecting the Dots: LLMs Can Infer and Verbalize Latent Structure from Disparate Training Data Cem Anil, Dami Choi, Jan Betley, Johannes Treutlein Published: 2024-06-20Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2024-06-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Jailbreaking as a Reward Misspecification Problem Jiahui Gao, Lei Li, Lingpeng Kong, Qi Liu Published: 2024-06-20Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| PKU-SafeRLHF: A Safety Alignment Preference Dataset for Llama Family Models Boren Zheng, Borong Zhang, Boxuan Li, Boyuan Chen Published: 2024-06-20Area: Alignment TrainingCitations: 127 Tags: ai-safety, alignment-training, dataset | 2024-06-20 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (96%) | 127 |
| Prompt Injection Attacks in Defended Systems Bulat Nutfullin, Daniil Khomsky, Narek Maloyan Published: 2024-06-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 6 |
| Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing Han Jiang, Shu Wang, XiaoYuan Yi, Xing Xie Published: 2024-06-20Area: Safety EvaluationCitations: 16 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |