Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Let's Verify Step by Step Bowen Baker, Harri Edwards, Hunter Lightman, Ilya Sutskever Published: 2023-05-31Area: Alignment TrainingCitations: 2550 Tags: ai-safety, alignment-training, empirical | 2023-05-31 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2550 |
| Learning Transformer Programs Alexander Wettig, Dan Friedman, Danqi Chen Published: 2023-06-01Area: Mechanistic Interp.Citations: 48 Tags: ai-safety, empirical, mechanistic-interp | 2023-06-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 48 |
| Fine-Grained Human Feedback Gives Better Rewards for Language Model Training Alane Suhr, Hannaneh Hajishirzi, Mari Ostendorf, Noah A. Smith Published: 2023-06-02Area: Alignment TrainingCitations: 430 Tags: ai-safety, alignment-training, empirical | 2023-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 430 |
| Inference-Time Intervention: Eliciting Truthful Answers from a Language Model Fernanda Vi脙漏gas, Hanspeter Pfister, Kenneth Li, Martin Wattenberg Published: 2023-06-06Area: Representation AnalysisCitations: 897 Tags: ai-safety, empirical, representation-analysis | 2023-06-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 897 |
| LEACE: Perfect Linear Concept Erasure in Closed Form David Schneider-Joseph, Edward Raff, Nora Belrose, Ryan Cotterell Published: 2023-06-06Area: Representation AnalysisCitations: 175 Tags: ai-safety, empirical, representation-analysis | 2023-06-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (96%) | 175 |
| Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards Alexandre Rame, Corentin Dancette, Guillaume Couairon, Jean-Baptiste Gaya Published: 2023-06-07Area: Alignment TrainingCitations: 216 Tags: ai-safety, alignment-training, empirical | 2023-06-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 216 |
| Prompt Injection attack against LLM-integrated Applications Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-06-08Area: Adversarial RobustnessCitations: 620 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 620 |
| Adversarial Attacks on the Interpretation of Neuron Activation Maximization Alexander Fulleringer, Eugene Belilovsky, G茅raldin Nanfack, Jonathan Marty Published: 2023-06-12Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 12 |
| Explore, Establish, Exploit: Red Teaming Language Models from Scratch Dylan Hadfield-Menell, Gatlen Culp, Jason Lin, Joe Kwon Published: 2023-06-15Area: Safety EvaluationCitations: 125 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 125 |
| Evaluating Superhuman Models with Consistency Checks Daniel Paleka, Florian Tram猫r, Lukas Fluri Published: 2023-06-16Area: Scalable OversightCitations: 49 Tags: ai-safety, empirical, scalable-oversight | 2023-06-16 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 49 |
| Visual Adversarial Examples Jailbreak Aligned Large Language Models Ashwinee Panda, Kaixuan Huang, Mengdi Wang, Peter Henderson Published: 2023-06-22Area: Multimodal SafetyCitations: 295 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-06-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 295 |
| Are Aligned Neural Networks Adversarially Aligned? Anas Awadalla, Christopher A. Choquette-Choo, Daphne Ippolito, Florian Tramer Published: 2023-06-26Area: Adversarial RobustnessCitations: 325 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 325 |
| On the Exploitability of Instruction Tuning Chaowei Xiao, Chen Zhu, Jiongxiao Wang, Jonas Geiping Published: 2023-06-28Area: Adversarial RobustnessCitations: 135 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 135 |
| Preference Ranking Optimization for Human Alignment Bowen Yu, Feifan Song, Fei Huang, Haiyang Yu Published: 2023-06-30Area: Alignment TrainingCitations: 340 Tags: ai-safety, alignment-training, empirical | 2023-06-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 340 |
| The Clock and the Pizza: Two Stories in Mechanistic Explanation of Neural Networks Jacob Andreas, Max Tegmark, Ziming Liu, Ziqian Zhong Published: 2023-06-30Area: Mechanistic Interp.Citations: 145 Tags: ai-safety, empirical, mechanistic-interp | 2023-06-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 145 |
| Evaluating Shutdown Avoidance of Language Models in Textual Scenarios Leon Lang, Simon Lermen, Teun van der Weij Published: 2023-07-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2023-07-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 7 |
| Hoodwinked: Deception and Cooperation in a Text-Based Game for Language Models Aidan O'Gara Published: 2023-07-05Area: Deception & FailureCitations: 51 Tags: ai-safety, deception-failure, empirical | 2023-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 51 |
| Jailbroken: How Does LLM Safety Training Fail? Alexander Wei, Jacob Steinhardt, Nika Haghtalab Published: 2023-07-05Area: Adversarial RobustnessCitations: 1522 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1522 |
| Discovering Variable Binding Circuitry with Desiderata David Bau, Max Nadeau, Nikhil Prakash, Tamar Rott Shaham Published: 2023-07-07Area: Mechanistic Interp.Citations: 22 Tags: ai-safety, empirical, mechanistic-interp | 2023-07-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R2 (94%) | 22 |
| Secrets of RLHF in Large Language Models Part I: PPO Binghai Wang, Cheng Chang, Hang Yan, Haoran Huang Published: 2023-07-11Area: Alignment TrainingCitations: 248 Tags: ai-safety, alignment-training, empirical | 2023-07-11 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 248 |
| Understanding Multi-Turn Toxic Behaviors in Open-Domain Chatbots Bocheng Chen, Guangjing Wang, Hanqing Guo, Qiben Yan Published: 2023-07-14Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 26 |
| MasterKey: Automated Jailbreaking of Large Language Model Chatbots Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-07-16Area: Adversarial RobustnessCitations: 206 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 206 |
| Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations Chen Zhao, He He, Jacob Steinhardt, Kathleen McKeown Published: 2023-07-17Area: Safety EvaluationCitations: 82 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 82 |
| Measuring Faithfulness in Chain-of-Thought Reasoning Anna Chen, Ansh Radhakrishnan, Benoit Steiner, Carson Denison Published: 2023-07-17Area: Safety EvaluationCitations: 336 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 336 |
| Question Decomposition Improves the Faithfulness of Model-Generated Reasoning Anna Chen, Ansh Radhakrishnan, Carol Chen, Carson Denison Published: 2023-07-17Area: Scalable OversightCitations: 111 Tags: ai-safety, empirical, scalable-oversight | 2023-07-17 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 111 |
| Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla Geoffrey Irving, J脙隆nos Kram脙隆r, Matthew Rahtz, Neel Nanda Published: 2023-07-18Area: Mechanistic Interp.Citations: 144 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-07-18 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 144 |
| Overthinking the Truth: Understanding How Language Models Process False Demonstrations Danny Halawi, Jacob Steinhardt, Jean-Stanislas Denain Published: 2023-07-18Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, empirical, mechanistic-interp | 2023-07-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 74 |
| (Ab)using Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs Ben Nassi, Eugene Bagdasaryan, Tsung-Yin Hsieh, Vitaly Shmatikov Published: 2023-07-19Area: Multimodal SafetyCitations: 121 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 121 |
| On Privileged and Convergent Bases in Neural Network Representations Davis Brown, Nikhil Vyas, Yamini Bansal Published: 2023-07-24Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2023-07-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | - |
| Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models Erfan Shayegani, Nael Abu-Ghazaleh, Yue Dong Published: 2023-07-26Area: Multimodal SafetyCitations: 240 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R2 (93%) | 240 |