Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization Guangyao Shen, Shiqi Shen, Wenkai Yang, Yankai Lin Published: 2024-06-17Area: Scalable OversightCitations: 20 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-06-17 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E6 / R3 (92%) | 20 |
| Transcoders Find Interpretable LLM Feature Circuits Jacob Dunefsky, Neel Nanda, Philippe Chlenski Published: 2024-06-17Area: Mechanistic Interp.Citations: 102 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-06-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 102 |
| Who's Asking? User Personas and the Mechanics of Latent Misalignment Ann Yuan, Asma Ghandeharioun, Emily Reif, Lucas Dixon Published: 2024-06-17Area: Representation AnalysisCitations: 23 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R4 (95%) | 23 |
| Dissecting Adversarial Robustness of Multimodal LM Agents Aditi Raghunathan, Chen Henry Wu, Daniel Fried, Jing Yu Koh Published: 2024-06-18Area: Adversarial RobustnessCitations: 84 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 84 |
| Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries Amir Globerson, Daniela Gottesman, Eden Biran, Mor Geva Published: 2024-06-18Area: Mechanistic Interp.Citations: 75 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | 75 |
| SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models Animesh Mukherjee, Rima Hazra, Sayan Layek, Shanu Kumar Published: 2024-06-18Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 14 |
| SNAP: Unlearning Selective Knowledge in Large Language Models with Negative Instructions Daniel Rim, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-06-18Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 7 |
| Stealth edits for provably fixing or attacking large language models Alexander Bastounis, Alexander N. Gorban, Desmond J. Higham, Ivan Y. Tyukin Published: 2024-06-18Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 2 |
| Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings Bingda Tang, Dongping Chen, Jingyu Tang, Lichao Sun Published: 2024-06-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 7 |
| Textual Unlearning Gives a False Sense of Unlearning Jiacheng Du, Jiahui Hu, Jie Zhang, Kui Ren Published: 2024-06-19Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | 9 |
| Towards Minimal Targeted Updates of Language Models with Targeted Negative Training Arya Tafvizi, Lily H. Zhang, Rajesh Ranganath Published: 2024-06-19Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2024-06-19 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (93%) | 1 |
| Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning Shengyuan Hu, Virginia Smith, Yiwei Fu, Zhiwei Steven Wu Published: 2024-06-19Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 40 |
| Adversaries Can Misuse Combinations of Safe Models Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2024-06-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 21 |
| Connecting the Dots: LLMs Can Infer and Verbalize Latent Structure from Disparate Training Data Cem Anil, Dami Choi, Jan Betley, Johannes Treutlein Published: 2024-06-20Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2024-06-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Jailbreaking as a Reward Misspecification Problem Jiahui Gao, Lei Li, Lingpeng Kong, Qi Liu Published: 2024-06-20Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| Prompt Injection Attacks in Defended Systems Bulat Nutfullin, Daniil Khomsky, Narek Maloyan Published: 2024-06-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 6 |
| Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons Jianhui Chen, Juanzi Li, Lei Hou, Xiaozhi Wang Published: 2024-06-20Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2024-06-20 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Robust Reinforcement Learning from Corrupted Human Feedback Alexander Bukharin, Haoming Jiang, Ilgee Hong, Qingru Zhang Published: 2024-06-21Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-06-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 18 |
| Steering Without Side Effects: Improving Post-Deployment Control of Language Models Alexander Lyzhov, Asa Cooper Stickland, Jacob Pfau, Salsabila Mahdi Published: 2024-06-21Area: Model EditingCitations: 41 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-06-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 41 |
| Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs Jannik Kossen, Jiatong Han, Lisa Schut, Muhammed Razzak Published: 2024-06-22Area: Representation AnalysisCitations: 138 Tags: ai-safety, empirical, representation-analysis | 2024-06-22 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 138 |
| Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models Jun Zhao, Kang Liu, Pengfei Cao, Tianyi Men Published: 2024-06-23Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-06-23 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 19 |
| BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models Bo Li, Dawn Song, Ruoxi Jia, Tran Ngoc Huynh Published: 2024-06-24Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 49 |
| Confidence Regulation Neurons in Language Models Alessandro Stolfo, Ben Wu, Mrinmaya Sachan, Neel Nanda Published: 2024-06-24Area: Mechanistic Interp.Citations: 45 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 45 |
| Finding Transformer Circuits with Edge Pruning Adithya Bhaskar, Alexander Wettig, Dan Friedman, Danqi Chen Published: 2024-06-24Area: Mechanistic Interp.Citations: 40 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | 40 |
| Interpreting Attention Layer Outputs with Sparse Autoencoders Arthur Conmy, Connor Kissane, Joseph Isaac Bloom, Neel Nanda Published: 2024-06-25Area: Mechanistic Interp.Citations: 40 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 40 |
| Understanding Language Model Circuits through Knowledge Editing Frank Rudzicz, Huaizhi Ge, Zining Zhu Published: 2024-06-25Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 2 |
| A Closer Look into Mixture-of-Experts in Large Language Models Jie Fu, Ka Man Lo, Zeyu Huang, Zihan Qiu Published: 2024-06-26Area: Mechanistic Interp.Citations: 28 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 28 |
| Enhancing Data Privacy in Large Language Models through Private Association Editing Andrea Favalli, Cristina Giannone, Davide Venditti, Elena Sofia Ruzzetti Published: 2024-06-26Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 7 |
| The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm Aakanksha, Arash Ahmadian, Beyza Ermis, Julia Kreutzer Published: 2024-06-26Area: Alignment TrainingCitations: 55 Tags: ai-safety, alignment-training, empirical | 2024-06-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 55 |
| Monitoring Latent World States in Language Models with Propositional Probes Jacob Steinhardt, Jiahai Feng, Stuart Russell Published: 2024-06-27Area: Representation AnalysisCitations: 23 Tags: ai-safety, empirical, representation-analysis | 2024-06-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (94%) | 23 |