Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Jailbroken: How Does LLM Safety Training Fail? Alexander Wei, Jacob Steinhardt, Nika Haghtalab Published: 2023-07-05Area: Adversarial RobustnessCitations: 1522 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1522 |
| Discovering Variable Binding Circuitry with Desiderata David Bau, Max Nadeau, Nikhil Prakash, Tamar Rott Shaham Published: 2023-07-07Area: Mechanistic Interp.Citations: 22 Tags: ai-safety, empirical, mechanistic-interp | 2023-07-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R2 (94%) | 22 |
| BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset Boyuan Chen, Ce Bian, Chi Zhang, Jiaming Ji Published: 2023-07-10Area: Alignment TrainingCitations: 767 Tags: ai-safety, alignment-training, dataset | 2023-07-10 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 767 |
| Secrets of RLHF in Large Language Models Part I: PPO Binghai Wang, Cheng Chang, Hang Yan, Haoran Huang Published: 2023-07-11Area: Alignment TrainingCitations: 248 Tags: ai-safety, alignment-training, empirical | 2023-07-11 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 248 |
| Understanding Multi-Turn Toxic Behaviors in Open-Domain Chatbots Bocheng Chen, Guangjing Wang, Hanqing Guo, Qiben Yan Published: 2023-07-14Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 26 |
| MasterKey: Automated Jailbreaking of Large Language Model Chatbots Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-07-16Area: Adversarial RobustnessCitations: 206 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 206 |
| Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations Chen Zhao, He He, Jacob Steinhardt, Kathleen McKeown Published: 2023-07-17Area: Safety EvaluationCitations: 82 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 82 |
| Measuring Faithfulness in Chain-of-Thought Reasoning Anna Chen, Ansh Radhakrishnan, Benoit Steiner, Carson Denison Published: 2023-07-17Area: Safety EvaluationCitations: 336 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 336 |
| Question Decomposition Improves the Faithfulness of Model-Generated Reasoning Anna Chen, Ansh Radhakrishnan, Carol Chen, Carson Denison Published: 2023-07-17Area: Scalable OversightCitations: 111 Tags: ai-safety, empirical, scalable-oversight | 2023-07-17 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 111 |
| Risk assessment at AGI companies: A review of popular risk assessment techniques from other safety-critical industries Jonas Schuett, Leonie Koessler Published: 2023-07-17Area: Surveys & ReviewsCitations: 35 Tags: ai-safety, survey, surveys-reviews | 2023-07-17 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E8 / R4 (98%) | 35 |
| Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla Geoffrey Irving, J脙隆nos Kram脙隆r, Matthew Rahtz, Neel Nanda Published: 2023-07-18Area: Mechanistic Interp.Citations: 144 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-07-18 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 144 |
| Overthinking the Truth: Understanding How Language Models Process False Demonstrations Danny Halawi, Jacob Steinhardt, Jean-Stanislas Denain Published: 2023-07-18Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, empirical, mechanistic-interp | 2023-07-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 74 |
| (Ab)using Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs Ben Nassi, Eugene Bagdasaryan, Tsung-Yin Hsieh, Vitaly Shmatikov Published: 2023-07-19Area: Multimodal SafetyCitations: 121 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 121 |
| CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility Chao Peng, Fei Huang, Guohai Xu, Haotian Xu Published: 2023-07-19Area: Safety EvaluationCitations: 99 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2023-07-19 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 99 |
| Deceptive Alignment Monitoring Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, position | 2023-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, position | E4 / R3 (95%) | 14 |
| FACADE: A Framework for Adversarial Circuit Anomaly Detection and Evaluation Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Mechanistic Interp.Citations: 2 Tags: adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | 2023-07-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | E5 / R3 (94%) | 2 |
| LLM Censorship: A Machine Learning Challenge or a Computer Security Problem? David Glukhov, Ilia Shumailov, Nicolas Papernot, Vardan Papyan Published: 2023-07-20Area: Adversarial RobustnessCitations: 72 Tags: adversarial-robustness, ai-safety, theoretical | 2023-07-20 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | 72 |
| Evaluating the Ripple Effects of Knowledge Editing in Language Models Amir Globerson, Eden Biran, Mor Geva, Ori Yoran Published: 2023-07-24Area: Model EditingCitations: 241 Tags: ai-safety, benchmark, model-editing | 2023-07-24 | Model Editing | ai-safety, benchmark, model-editing | E4 / R3 (94%) | 241 |
| On Privileged and Convergent Bases in Neural Network Representations Davis Brown, Nikhil Vyas, Yamini Bansal Published: 2023-07-24Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2023-07-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | - |
| Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models Erfan Shayegani, Nael Abu-Ghazaleh, Yue Dong Published: 2023-07-26Area: Multimodal SafetyCitations: 240 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R2 (93%) | 240 |
| A Geometric Notion of Causal Probing Alexander Warstadt, Anej Svete, Cl茅ment Guerner, Ryan Cotterell Published: 2023-07-27Area: Representation AnalysisCitations: 25 Tags: ai-safety, representation-analysis, theoretical | 2023-07-27 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (92%) | 25 |
| Backdoor Attacks for In-Context Learning with Language Models Florian Tram猫r, Matthew Jagielski, Nicholas Carlini, Nikhil Kandpal Published: 2023-07-27Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 111 |
| Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback Anand Siththaranjan, Anca Dragan, Andi Peng, Charbel-Raphael Segerie Published: 2023-07-27Area: Alignment TrainingCitations: 761 Tags: ai-safety, alignment-training, survey | 2023-07-27 | Alignment Training | ai-safety, alignment-training, survey | E5 / R3 (97%) | 761 |
| Universal and Transferable Adversarial Attacks on Aligned Language Models Andy Zou, J. Zico Kolter, Matt Fredrikson, Milad Nasr Published: 2023-07-27Area: Adversarial RobustnessCitations: 2514 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2514 |
| The Hydra Effect: Emergent Self-repair in Language Model Computations Janos Kramar, Matthew Rahtz, Shane Legg, Thomas McGrath Published: 2023-07-28Area: Mechanistic Interp.Citations: 96 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-07-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | 96 |
| XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models Bertie Vidgen, Dirk Hovy, Federico Bianchi, Giuseppe Attanasio Published: 2023-08-02Area: Safety EvaluationCitations: 283 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 283 |
| Circumventing Concept Erasure Methods For Text-to-Image Generative Models Chinmay Hegde, Govind Mittal, Kelly O. Marshall, Minh Pham Published: 2023-08-03Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 73 |
| "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models Michael Backes, Xinyue Shen, Yang Zhang, Yun Shen Published: 2023-08-07Area: Adversarial RobustnessCitations: 497 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (97%) | 497 |
| Simple synthetic data reduces sycophancy in large language models Da Huang, Denny Zhou, Jerry Wei, Quoc V. Le Published: 2023-08-07Area: Deception & FailureCitations: 112 Tags: ai-safety, deception-failure, empirical | 2023-08-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 112 |
| Studying Large Language Model Generalization with Influence Functions Alex Tamkin, Amirhossein Tajdini, Benoit Steiner, Cem Anil Published: 2023-08-07Area: Training DynamicsCitations: 286 Tags: ai-safety, empirical, training-dynamics | 2023-08-07 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (94%) | 286 |