Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Can Language Models be Instructed to Protect Personal Information? Alan Ritter, Ethan Mendes, Sauvik Das, Wei Xu Published: 2023-10-03Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 48 |
| Language Models Represent Space and Time Max Tegmark, Wes Gurnee Published: 2023-10-03Area: Representation AnalysisCitations: 259 Tags: ai-safety, empirical, representation-analysis | 2023-10-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (93%) | 259 |
| Low-Resource Languages Jailbreak GPT-4 Cristina Menghini, Stephen H. Bach, Zheng-Xin Yong Published: 2023-10-03Area: Adversarial RobustnessCitations: 291 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 291 |
| Who's Harry Potter? Approximate Unlearning in LLMs Mark Russinovich, Ronen Eldan Published: 2023-10-03Area: Model EditingCitations: 335 Tags: ai-safety, empirical, model-editing | 2023-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 335 |
| Discovering Knowledge-Critical Subnetworks in Pretrained Language Models Antoine Bosselut, Deniz Bayazit, Gail Weiss, Negar Foroutan Published: 2023-10-04Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 20 |
| Misusing Tools in Large Language Models With Visual Adversarial Examples Earlence Fernandes, Niloofar Mireshghallah, Rajesh K. Gupta, Shuheng Li Published: 2023-10-04Area: Multimodal SafetyCitations: 35 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-10-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 35 |
| Reward Model Ensembles Help Mitigate Overoptimization David Krueger, Robert Kirk, Thomas Coste, Usman Anwar Published: 2023-10-04Area: Alignment TrainingCitations: 190 Tags: ai-safety, alignment-training, empirical | 2023-10-04 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (96%) | 190 |
| Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models Dahua Lin, Linda Petzold, Qi Zhang, William Yang Wang Published: 2023-10-04Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (98%) | 261 |
| A Long Way to Go: Investigating Length Correlations in RLHF Greg Durrett, Jiacheng Xu, Prasann Singhal, Tanya Goyal Published: 2023-10-05Area: Alignment TrainingCitations: 223 Tags: ai-safety, alignment-training, empirical | 2023-10-05 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 223 |
| SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks Alexander Robey, Eric Wong, George J. Pappas, Hamed Hassani Published: 2023-10-05Area: Adversarial RobustnessCitations: 414 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 414 |
| Copy Suppression: Comprehensively Understanding an Attention Head Arthur Conmy, Callum McDougall, Cody Rushing, Neel Nanda Published: 2023-10-06Area: Mechanistic Interp.Citations: 56 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 56 |
| AI Systems of Concern Fazl Barez, Kayla Matteucci, Se谩n 脫 h脡igeartaigh, Shahar Avin Published: 2023-10-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, position | 2023-10-09 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (95%) | 1 |
| Interpreting CLIP's Image Representation via Text-Based Decomposition Alexei A. Efros, Jacob Steinhardt, Yossi Gandelsman Published: 2023-10-09Area: Representation AnalysisCitations: 159 Tags: ai-safety, empirical, representation-analysis | 2023-10-09 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 159 |
| SALMON: Self-Alignment with Principle-Following Reward Models Chuang Gan, David Cox, Hongxin Zhang, Qinhong Zhou Published: 2023-10-09Area: Alignment TrainingCitations: 55 Tags: ai-safety, alignment-training, empirical | 2023-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 55 |
| SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese Hang Xue, Kangkang Zhao, Lei Zhu, Liang Xu Published: 2023-10-09Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 22 |
| The Importance of Prompt Tuning for Automated Neuron Explanations Arjun Chatha, Justin Lee, Keng-Chi Chang, Tsui-Wei Weng Published: 2023-10-09Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 11 |
| Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation Danqi Chen, Kai Li, Mengzhou Xia, Samyak Gupta Published: 2023-10-10Area: Adversarial RobustnessCitations: 437 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R4 (96%) | 437 |
| Dynamical versus Bayesian Phase Transitions in a Toy Model of Superposition Daniel Murfet, Edmund Lau, Jake Mendel, Susan Wei Published: 2023-10-10Area: Training DynamicsCitations: 22 Tags: ai-safety, theoretical, training-dynamics | 2023-10-10 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 22 |
| Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations Yifei Wang, Yisen Wang, Zeming Wei Published: 2023-10-10Area: Adversarial RobustnessCitations: 423 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (95%) | 423 |
| Multilingual Jailbreak Challenges in Large Language Models Lidong Bing, Sinno Jialin Pan, Wenxuan Zhang, Yue Deng Published: 2023-10-10Area: Adversarial RobustnessCitations: 207 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 207 |
| The Geometry of Truth: Emergent Linear Structure in LLM Representations of True/False Datasets Max Tegmark, Samuel Marks Published: 2023-10-10Area: Representation AnalysisCitations: 402 Tags: ai-safety, empirical, representation-analysis | 2023-10-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 402 |
| Understanding the Effects of RLHF on LLM Generalisation and Diversity Christoforos Nalmpantis, Edward Grefenstette, Eric Hambro, Ishita Mediratta Published: 2023-10-10Area: Alignment TrainingCitations: 295 Tags: ai-safety, alignment-training, empirical | 2023-10-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 295 |
| An Adversarial Example for Direct Logit Attribution: Memory Management in GELU-4L Can Rager, James Dao, Jett Janiak, Yeu-Tong Lau Published: 2023-10-11Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-10-11 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 6 |
| In-Context Unlearning: Language Models as Few Shot Unlearners Himabindu Lakkaraju, Martin Pawelczyk, Seth Neel Published: 2023-10-11Area: Model EditingCitations: 197 Tags: ai-safety, empirical, model-editing | 2023-10-11 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 197 |
| Circuit Component Reuse Across Tasks in Transformer Language Models Carsten Eickhoff, Ellie Pavlick, Jack Merullo Published: 2023-10-12Area: Mechanistic Interp.Citations: 99 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (96%) | 99 |
| Interpreting Learned Feedback Patterns in Large Language Models Amir Abdullah, Clement Neo, Fazl Barez, Luke Marks Published: 2023-10-12Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 5 |
| Jailbreaking Black Box Large Language Models in Twenty Queries Alexander Robey, Edgar Dobriban, Eric Wong, George J. Pappas Published: 2023-10-12Area: Adversarial RobustnessCitations: 1175 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1175 |
| Understanding and Controlling a Maze-Solving Policy Network Alexander Matt Turner, Austin Meek, Monte MacDiarmid, Mrinank Sharma Published: 2023-10-12Area: Mechanistic Interp.Citations: 22 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | 22 |
| Large Language Model Unlearning Xiaojun Xu, Yang Liu, Yuanshun Yao Published: 2023-10-14Area: Model EditingCitations: 248 Tags: ai-safety, empirical, model-editing | 2023-10-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (92%) | 248 |
| Attribution Patching Outperforms Automated Circuit Discovery Aaquib Syed, Arthur Conmy, Can Rager Published: 2023-10-16Area: Mechanistic Interp.Citations: 108 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 108 |