Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu Published: 2023-09-12Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 137 |
| RAIN: Your Language Models Can Align Themselves without Finetuning Chao Zhang, Fangyun Wei, Hongyang Zhang, Jinjing Zhao Published: 2023-09-13Area: Alignment TrainingCitations: 161 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-09-13 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 161 |
| Sudden Drops in the Loss: Syntax Acquisition, Phase Transitions, and Simplicity Bias in MLMs Angelica Chen, Kyunghyun Cho, Matthew L. Leavitt, Naomi Saphra Published: 2023-09-13Area: Training DynamicsCitations: 109 Tags: ai-safety, empirical, training-dynamics | 2023-09-13 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (97%) | 109 |
| Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions Dan Jurafsky, Federico Bianchi, Giuseppe Attanasio, James Zou Published: 2023-09-14Area: Alignment TrainingCitations: 343 Tags: ai-safety, alignment-training, empirical | 2023-09-14 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 343 |
| Sparse Autoencoders Find Highly Interpretable Features in Language Models Aidan Ewart, Hoagy Cunningham, Lee Sharkey, Logan Riggs Published: 2023-09-15Area: Mechanistic Interp.Citations: 881 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | 881 |
| Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM Bochuan Cao, Jinghui Chen, Lu Lin, Yuanpu Cao Published: 2023-09-18Area: Adversarial RobustnessCitations: 211 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R2 (96%) | 211 |
| Rigorously Assessing Natural Language Explanations of Neurons Atticus Geiger, Christopher Potts, Jing Huang, Karel D'Oosterlinck Published: 2023-09-19Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2023-09-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 41 |
| How Robust is Google's Bard to Adversarial Image Attacks? Hang Su, Huanran Chen, Jiawei Chen, Jun Zhu Published: 2023-09-21Area: Multimodal SafetyCitations: 174 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (95%) | 174 |
| Knowledge Sanitization of Large Language Models Hidetoshi Shimodaira, Yoichi Ishibashi Published: 2023-09-21Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2023-09-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 37 |
| The Reversal Curse: LLMs trained on 'A is B' fail to learn 'B is A' Asa Cooper Stickland, Lukas Berglund, Max Kaufmann, Meg Tong Published: 2023-09-21Area: Training DynamicsCitations: 425 Tags: ai-safety, empirical, training-dynamics | 2023-09-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 425 |
| How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions Alexa Y. Pan, Alex J. Chan, Ilan Moscovitz, Jan Brauner Published: 2023-09-26Area: Safety EvaluationCitations: 80 Tags: ai-safety, empirical, safety-evaluation | 2023-09-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 80 |
| Towards Best Practices of Activation Patching in Language Models: Metrics and Methods Fred Zhang, Neel Nanda Published: 2023-09-27Area: Mechanistic Interp.Citations: 193 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-09-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | 193 |
| The Trickle-down Impact of Reward (In-)consistency on RLHF Baolin Peng, Daniel Khashabi, Dong Yu, Haitao Mi Published: 2023-09-28Area: Alignment TrainingCitations: 28 Tags: ai-safety, alignment-training, empirical | 2023-09-28 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 28 |
| Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks Mohit Bansal, Peter Hase, Vaidehi Patil Published: 2023-09-29Area: Model EditingCitations: 154 Tags: ai-safety, empirical, model-editing | 2023-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 154 |
| Efficient Streaming Language Models with Attention Sinks Beidi Chen, Guangxuan Xiao, Mike Lewis, Song Han Published: 2023-09-29Area: Mechanistic Interp.Citations: 1422 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 1422 |
| Red Teaming Game: A Game-Theoretic Framework for Red Teaming Language Models Chengdong Ma, Hai Ci, Jun Gao, Minquan Gao Published: 2023-09-30Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 13 |
| LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model Ankit Shah, Bhiksha Raj, Dareen Alharthi, Hazim T Bukhari Published: 2023-10-02Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 24 |
| Representation Engineering: A Top-Down Approach to AI Transparency Alexander Pan, Alex Mallen, Andy Zou, Ann-Kathrin Dombrowski Published: 2023-10-02Area: Representation AnalysisCitations: 780 Tags: ai-safety, empirical, representation-analysis | 2023-10-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 780 |
| AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models Chaowei Xiao, Muhao Chen, Nan Xu, Xiaogeng Liu Published: 2023-10-03Area: Adversarial RobustnessCitations: 618 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 618 |
| Language Models Represent Space and Time Max Tegmark, Wes Gurnee Published: 2023-10-03Area: Representation AnalysisCitations: 259 Tags: ai-safety, empirical, representation-analysis | 2023-10-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (93%) | 259 |
| Low-Resource Languages Jailbreak GPT-4 Cristina Menghini, Stephen H. Bach, Zheng-Xin Yong Published: 2023-10-03Area: Adversarial RobustnessCitations: 291 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 291 |
| Who's Harry Potter? Approximate Unlearning in LLMs Mark Russinovich, Ronen Eldan Published: 2023-10-03Area: Model EditingCitations: 335 Tags: ai-safety, empirical, model-editing | 2023-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 335 |
| Discovering Knowledge-Critical Subnetworks in Pretrained Language Models Antoine Bosselut, Deniz Bayazit, Gail Weiss, Negar Foroutan Published: 2023-10-04Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 20 |
| Misusing Tools in Large Language Models With Visual Adversarial Examples Earlence Fernandes, Niloofar Mireshghallah, Rajesh K. Gupta, Shuheng Li Published: 2023-10-04Area: Multimodal SafetyCitations: 35 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-10-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 35 |
| Reward Model Ensembles Help Mitigate Overoptimization David Krueger, Robert Kirk, Thomas Coste, Usman Anwar Published: 2023-10-04Area: Alignment TrainingCitations: 190 Tags: ai-safety, alignment-training, empirical | 2023-10-04 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (96%) | 190 |
| Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models Dahua Lin, Linda Petzold, Qi Zhang, William Yang Wang Published: 2023-10-04Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (98%) | 261 |
| A Long Way to Go: Investigating Length Correlations in RLHF Greg Durrett, Jiacheng Xu, Prasann Singhal, Tanya Goyal Published: 2023-10-05Area: Alignment TrainingCitations: 223 Tags: ai-safety, alignment-training, empirical | 2023-10-05 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 223 |
| SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks Alexander Robey, Eric Wong, George J. Pappas, Hamed Hassani Published: 2023-10-05Area: Adversarial RobustnessCitations: 414 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 414 |
| Copy Suppression: Comprehensively Understanding an Attention Head Arthur Conmy, Callum McDougall, Cody Rushing, Neel Nanda Published: 2023-10-06Area: Mechanistic Interp.Citations: 56 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 56 |
| Interpreting CLIP's Image Representation via Text-Based Decomposition Alexei A. Efros, Jacob Steinhardt, Yossi Gandelsman Published: 2023-10-09Area: Representation AnalysisCitations: 159 Tags: ai-safety, empirical, representation-analysis | 2023-10-09 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 159 |