Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| FIND: A Function Description Benchmark for Evaluating Interpretability Methods Antonio Torralba, David Bau, Jacob Andreas, Joanna Materzynska Published: 2023-09-07Area: Mechanistic Interp.Citations: 32 Tags: ai-safety, benchmark, interpretability, mechanistic-interp | 2023-09-07 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp | E4 / R3 (94%) | 32 |
| Neurons in Large Language Models: Dead, N-gram, Positional Christoforos Nalmpantis, Elena Voita, Javier Ferrando Published: 2023-09-09Area: Mechanistic Interp.Citations: 75 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 75 |
| Uncovering Mesa-Optimization Algorithms in Transformers Alexander Meulemans, Blaise Ag眉era y Arcas, Eyvind Niklasson, Jo茫o Sacramento Published: 2023-09-11Area: Mechanistic Interp.Citations: 86 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 86 |
| Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review Gongshen Liu, Haodong Zhao, Pengzhou Cheng, Wei Du Published: 2023-09-12Area: Adversarial RobustnessCitations: 51 Tags: adversarial-robustness, ai-safety, survey | 2023-09-12 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E7 / R3 (94%) | 51 |
| Circuit Breaking: Removing Model Behaviors with Targeted Ablation Maximilian Li, Max Nadeau, Xander Davies Published: 2023-09-12Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2023-09-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (94%) | 34 |
| Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu Published: 2023-09-12Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 137 |
| RAIN: Your Language Models Can Align Themselves without Finetuning Chao Zhang, Fangyun Wei, Hongyang Zhang, Jinjing Zhao Published: 2023-09-13Area: Alignment TrainingCitations: 161 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-09-13 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 161 |
| SafetyBench: Evaluating the Safety of Large Language Models Chong Long, Jie Tang, Leqi Lei, Lindong Wu Published: 2023-09-13Area: Safety EvaluationCitations: 182 Tags: ai-safety, benchmark, safety-evaluation | 2023-09-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 182 |
| Sudden Drops in the Loss: Syntax Acquisition, Phase Transitions, and Simplicity Bias in MLMs Angelica Chen, Kyunghyun Cho, Matthew L. Leavitt, Naomi Saphra Published: 2023-09-13Area: Training DynamicsCitations: 109 Tags: ai-safety, empirical, training-dynamics | 2023-09-13 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (97%) | 109 |
| Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions Dan Jurafsky, Federico Bianchi, Giuseppe Attanasio, James Zou Published: 2023-09-14Area: Alignment TrainingCitations: 343 Tags: ai-safety, alignment-training, empirical | 2023-09-14 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 343 |
| Sparse Autoencoders Find Highly Interpretable Features in Language Models Aidan Ewart, Hoagy Cunningham, Lee Sharkey, Logan Riggs Published: 2023-09-15Area: Mechanistic Interp.Citations: 881 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | 881 |
| Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM Bochuan Cao, Jinghui Chen, Lu Lin, Yuanpu Cao Published: 2023-09-18Area: Adversarial RobustnessCitations: 211 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R2 (96%) | 211 |
| GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts Jiahao Yu, Xingwei Lin, Xinyu Xing, Zheng Yu Published: 2023-09-19Area: Adversarial RobustnessCitations: 537 Tags: adversarial-robustness, ai-safety, red-teaming, tool | 2023-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, red-teaming, tool | E5 / R3 (97%) | 537 |
| Rigorously Assessing Natural Language Explanations of Neurons Atticus Geiger, Christopher Potts, Jing Huang, Karel D'Oosterlinck Published: 2023-09-19Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2023-09-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 41 |
| How Robust is Google's Bard to Adversarial Image Attacks? Hang Su, Huanran Chen, Jiawei Chen, Jun Zhu Published: 2023-09-21Area: Multimodal SafetyCitations: 174 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (95%) | 174 |
| Knowledge Sanitization of Large Language Models Hidetoshi Shimodaira, Yoichi Ishibashi Published: 2023-09-21Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2023-09-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 37 |
| The Reversal Curse: LLMs trained on 'A is B' fail to learn 'B is A' Asa Cooper Stickland, Lukas Berglund, Max Kaufmann, Meg Tong Published: 2023-09-21Area: Training DynamicsCitations: 425 Tags: ai-safety, empirical, training-dynamics | 2023-09-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 425 |
| Identifying the Risks of LM Agents with an LM-Emulated Sandbox Andrew Wang, Chris J. Maddison, Honghua Dong, Jimmy Ba Published: 2023-09-25Area: Agent SafetyCitations: 217 Tags: agent-safety, ai-safety, tool | 2023-09-25 | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (95%) | 217 |
| How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions Alexa Y. Pan, Alex J. Chan, Ilan Moscovitz, Jan Brauner Published: 2023-09-26Area: Safety EvaluationCitations: 80 Tags: ai-safety, empirical, safety-evaluation | 2023-09-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 80 |
| Large Language Model Alignment: A Survey Chuang Liu, Deyi Xiong, Renren Jin, Tianhao Shen Published: 2023-09-26Area: Surveys & ReviewsCitations: 292 Tags: adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | 2023-09-26 | Surveys & Reviews | adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | E6 / R4 (97%) | 292 |
| Identifying and Mitigating Privacy Risks Stemming from Language Models: A Survey Adrian Weller, Ali Shahin Shamsabadi, Carolyn Ashurst, Victoria Smith Published: 2023-09-27Area: Surveys & ReviewsCitations: 41 Tags: ai-safety, survey, surveys-reviews | 2023-09-27 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (97%) | 41 |
| Towards Best Practices of Activation Patching in Language Models: Metrics and Methods Fred Zhang, Neel Nanda Published: 2023-09-27Area: Mechanistic Interp.Citations: 193 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-09-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | 193 |
| The Trickle-down Impact of Reward (In-)consistency on RLHF Baolin Peng, Daniel Khashabi, Dong Yu, Haitao Mi Published: 2023-09-28Area: Alignment TrainingCitations: 28 Tags: ai-safety, alignment-training, empirical | 2023-09-28 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 28 |
| Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks Mohit Bansal, Peter Hase, Vaidehi Patil Published: 2023-09-29Area: Model EditingCitations: 154 Tags: ai-safety, empirical, model-editing | 2023-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 154 |
| Efficient Streaming Language Models with Attention Sinks Beidi Chen, Guangxuan Xiao, Mike Lewis, Song Han Published: 2023-09-29Area: Mechanistic Interp.Citations: 1422 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 1422 |
| Deployment Corrections: An incident response framework for frontier AI models Joe O'Brien, Shaun Ee, Zoe Williams Published: 2023-09-30Area: Safety EvaluationCitations: 22 Tags: ai-safety, position, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (92%) | 22 |
| Red Teaming Game: A Game-Theoretic Framework for Red Teaming Language Models Chengdong Ma, Hai Ci, Jun Gao, Minquan Gao Published: 2023-09-30Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 13 |
| LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model Ankit Shah, Bhiksha Raj, Dareen Alharthi, Hazim T Bukhari Published: 2023-10-02Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 24 |
| Representation Engineering: A Top-Down Approach to AI Transparency Alexander Pan, Alex Mallen, Andy Zou, Ann-Kathrin Dombrowski Published: 2023-10-02Area: Representation AnalysisCitations: 780 Tags: ai-safety, empirical, representation-analysis | 2023-10-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 780 |
| AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models Chaowei Xiao, Muhao Chen, Nan Xu, Xiaogeng Liu Published: 2023-10-03Area: Adversarial RobustnessCitations: 618 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 618 |