Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Holistic Evaluation of Language Models Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan Published: 2022-11-16Area: Safety EvaluationCitations: 10 Tags: ai-safety, benchmark, safety-evaluation | 2022-11-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 10 |
| Ignore Previous Prompt: Attack Techniques For Language Models F谩bio Perez, Ian Ribeiro Published: 2022-11-17Area: Adversarial RobustnessCitations: 675 Tags: adversarial-robustness, ai-safety, empirical | 2022-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 675 |
| Diagnostics for Deep Neural Networks with Automated Copy/Paste Attacks Dylan Hadfield-Menell, Kaivalya Hariharan, Stephen Casper Published: 2022-11-18Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-18 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 11 |
| Aging with GRACE: Lifelong Model Editing with Discrete Key-Value Adaptors Hamid Palangi, Marzyeh Ghassemi, Swami Sankaranarayanan, Thomas Hartvigsen Published: 2022-11-20Area: Model EditingCitations: 251 Tags: ai-safety, empirical, model-editing | 2022-11-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 251 |
| Interpreting Neural Networks through the Polytope Lens Beren Millidge, Carlos Ram贸n Guevara, Connor Leahy, Dan Braun Published: 2022-11-22Area: Mechanistic Interp.Citations: 36 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2022-11-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (95%) | 36 |
| Solving Math Word Problems with Process- and Outcome-Based Feedback Antonia Creswell, Francis Song, Geoffrey Irving, Irina Higgins Published: 2022-11-25Area: Scalable OversightCitations: 591 Tags: ai-safety, empirical, scalable-oversight | 2022-11-25 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (94%) | 591 |
| Self-Destructing Models: Increasing the Costs of Harmful Dual Uses of Foundation Models Chelsea Finn, Christopher D. Manning, Dan Jurafsky, Eric Mitchell Published: 2022-11-27Area: Model EditingCitations: 65 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2022-11-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 65 |
| Discovering Latent Knowledge in Language Models Without Supervision Collin Burns, Dan Klein, Haotian Ye, Jacob Steinhardt Published: 2022-12-07Area: Representation AnalysisCitations: 571 Tags: ai-safety, empirical, representation-analysis | 2022-12-07 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (96%) | 571 |
| Editing Models with Task Arithmetic Ali Farhadi, Gabriel Ilharco, Hannaneh Hajishirzi, Ludwig Schmidt Published: 2022-12-08Area: Model EditingCitations: 828 Tags: ai-safety, empirical, model-editing | 2022-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 828 |
| Constitutional AI: Harmlessness from AI Feedback Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-12-15Area: Alignment TrainingCitations: 2490 Tags: ai-safety, alignment-training, empirical | 2022-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2490 |
| On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning Diyi Yang, Hongxin Zhang, Michael Bernstein, Omar Shaikh Published: 2022-12-15Area: Safety EvaluationCitations: 249 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2022-12-15 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 249 |
| Transformers Learn In-Context by Gradient Descent Alexander Mordvintsev, Andrey Zhmoginov, Ettore Randazzo, Eyvind Niklasson Published: 2022-12-15Area: Training DynamicsCitations: 677 Tags: ai-safety, theoretical, training-dynamics | 2022-12-15 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 677 |
| Fine-Tuning Is All You Need to Mitigate Backdoor Attacks Mathias Humbert, Pascal Berrang, Xinlei He, Yang Zhang Published: 2022-12-18Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2022-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 49 |
| Discovering Language Model Behaviors with Model-Written Evaluations Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-12-19Area: Safety EvaluationCitations: 640 Tags: ai-safety, benchmark, safety-evaluation | 2022-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 640 |
| Circumventing interpretability: How to defeat mind-readers Lee Sharkey Published: 2022-12-21Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, interpretability, position | 2022-12-21 | Deception & Failure | ai-safety, deception-failure, interpretability, position | E5 / R3 (93%) | 5 |
| Can Large Language Models Change User Preference Adversarially? Varshini Subhash Published: 2023-01-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-01-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 9 |
| Does Localization Inform Editing? Surprising Differences in Causality-Based Localization vs. Knowledge Editing in Language Models Asma Ghandeharioun, Been Kim, Mohit Bansal, Peter Hase Published: 2023-01-10Area: Model EditingCitations: 240 Tags: ai-safety, empirical, model-editing | 2023-01-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 240 |
| Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability Amir Zur, Aryaman Arora, Atticus Geiger, Christopher Potts Published: 2023-01-11Area: Mechanistic Interp.Citations: 118 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2023-01-11 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R3 (95%) | 118 |
| Progress Measures for Grokking via Mechanistic Interpretability Jacob Steinhardt, Jess Smith, Lawrence Chan, Neel Nanda Published: 2023-01-12Area: Training DynamicsCitations: 680 Tags: ai-safety, empirical, interpretability, training-dynamics | 2023-01-12 | Training Dynamics | ai-safety, empirical, interpretability, training-dynamics | E5 / R3 (95%) | 680 |
| Tracr: Compiled Transformers as a Laboratory for Interpretability David Lindner, Janos Kramar, Matthew Rahtz, Sebastian Farquhar Published: 2023-01-12Area: Mechanistic Interp.Citations: 91 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-01-12 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R4 (95%) | 91 |
| A Watermark for Large Language Models Ian Miers, John Kirchenbauer, Jonas Geiping, Jonathan Katz Published: 2023-01-24Area: Safety EvaluationCitations: 777 Tags: ai-safety, empirical, safety-evaluation | 2023-01-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 777 |
| Transformer-Patcher: One Mistake worth One Neuron Jie Zhou, Wenge Rong, Xiaofeng Zhang, Yikang Shen Published: 2023-01-24Area: Model EditingCitations: 217 Tags: ai-safety, empirical, model-editing | 2023-01-24 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 217 |
| Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity Chunyang Chen, Terry Yue Zhuo, Yujin Huang, Zhenchang Xing Published: 2023-01-30Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R5 (96%) | 137 |
| Conditioning Predictive Models: Risks and Strategies Adam S. Jermyn, Evan Hubinger, Johannes Treutlein, Kate Woolverton Published: 2023-02-02Area: Deception & FailureCitations: 8 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-02-02 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | 8 |
| A Toy Model of Universality: Reverse Engineering How Networks Learn Group Operations Bilal Chughtai, Lawrence Chan, Neel Nanda Published: 2023-02-06Area: Mechanistic Interp.Citations: 135 Tags: ai-safety, empirical, mechanistic-interp | 2023-02-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 135 |
| Adversarial Prompting for Black Box Foundation Models Eric Wong, Jacob Gardner, Natalie Maus, Patrick Chao Published: 2023-02-08Area: Adversarial RobustnessCitations: 77 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 77 |
| Red Teaming Deep Neural Networks with Feature Synthesis Tools Dylan Hadfield-Menell, Jiawei Li, Kaivalya Hariharan, Kevin Zhang Published: 2023-02-08Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | 2023-02-08 | Safety Evaluation | ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | E6 / R3 (96%) | 21 |
| Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks Carlos Guestrin, Daniel Kang, Ion Stoica, Matei Zaharia Published: 2023-02-11Area: Adversarial RobustnessCitations: 345 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 345 |
| The Capacity for Moral Self-Correction in Large Language Models Amanda Askell, Anna Chen, Anna Goldie, Azalia Mirhoseini Published: 2023-02-15Area: Alignment TrainingCitations: 196 Tags: ai-safety, alignment-training, empirical | 2023-02-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 196 |
| Aligning Language Models with Preferences through f-divergence Minimization Dongyoung Go, Germ谩n Kruszewski, Jos Rozen, Marc Dymetman Published: 2023-02-16Area: Alignment TrainingCitations: 114 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 114 |