Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Language Models (Mostly) Know What They Know Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-07-11Area: Safety EvaluationCitations: 1254 Tags: ai-safety, empirical, safety-evaluation | 2022-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 1254 |
| Adversarial Attacks on Image Generation With Made-Up Words Rapha毛l Milli猫re Published: 2022-08-04Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2022-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 43 |
| Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-08-23Area: Safety EvaluationCitations: 675 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2022-08-23 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 675 |
| Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples Aditya Bahl, Daniel del Castillo Iglesias, Hezekiah J. Branch, Jeremy McHugh Published: 2022-09-05Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, empirical | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 74 |
| Red Teaming with Mind Reading: White-Box Adversarial Policies Against RL Agents Dylan Hadfield-Menell, Gabriel Kreiman, Stephen Casper, Taylor Killian Published: 2022-09-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | 1 |
| Analyzing Transformers in Embedding Space Ankit Gupta, Guy Dar, Jonathan Berant, Mor Geva Published: 2022-09-06Area: Mechanistic Interp.Citations: 127 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2022-09-06 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (96%) | 127 |
| Improving alignment of dialogue agents via targeted human judgements Abigail See, Amelia Glaese, Boxi Wu, Charlie Chen Published: 2022-09-28Area: Alignment TrainingCitations: 649 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2022-09-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 649 |
| Red-Teaming the Stable Diffusion Safety Filter Daniel Paleka, David Lindner, Florian Tram猫r, Javier Rando Published: 2022-10-03Area: Multimodal SafetyCitations: 262 Tags: ai-safety, empirical, multimodal-safety | 2022-10-03 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 262 |
| Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals Jonathan Uesato, Mary Phuong, Ramana Kumar, Rohin Shah Published: 2022-10-04Area: Deception & FailureCitations: 114 Tags: ai-safety, deception-failure, empirical | 2022-10-04 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 114 |
| Knowledge Unlearning for Mitigating Privacy Risks in Language Models Dongkeun Yoon, Joel Jang, Lajanugen Logeswaran, Minjoon Seo Published: 2022-10-04Area: Model EditingCitations: 385 Tags: ai-safety, empirical, model-editing | 2022-10-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 385 |
| Mass-Editing Memory in a Transformer Alex Andonian, Arnab Sen Sharma, David Bau, Kevin Meng Published: 2022-10-13Area: Model EditingCitations: 851 Tags: ai-safety, empirical, model-editing | 2022-10-13 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 851 |
| Scaling Laws for Reward Model Overoptimization Jacob Hilton, John Schulman, Leo Gao Published: 2022-10-19Area: Alignment TrainingCitations: 848 Tags: ai-safety, alignment-training, empirical | 2022-10-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 848 |
| Two-Turn Debate Doesn't Help Humans Answer Hard Reading Comprehension Questions Alicia Parrish, Amanpreet Singh Saimbhi, Harsh Trivedi, Jason Phang Published: 2022-10-19Area: Scalable OversightCitations: 15 Tags: ai-safety, empirical, scalable-oversight | 2022-10-19 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 15 |
| Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task Aspen K. Hopkins, David Bau, Fernanda Vi脙漏gas, Hanspeter Pfister Published: 2022-10-24Area: Representation AnalysisCitations: 411 Tags: ai-safety, empirical, representation-analysis | 2022-10-24 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (96%) | 411 |
| Adversarial Policies Beat Superhuman Go AIs Adam Gleave, Joseph Miller, Kellin Pelrine, Michael D. Dennis Published: 2022-11-01Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 33 |
| Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 Small Alexandre Variengien, Arthur Conmy, Buck Shlegeris, Jacob Steinhardt Published: 2022-11-01Area: Mechanistic Interp.Citations: 834 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2022-11-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 834 |
| Inverse Scaling Can Become U-Shaped Jason Wei, Najoung Kim, Quoc V. Le, Yi Tay Published: 2022-11-03Area: Training DynamicsCitations: 79 Tags: ai-safety, empirical, training-dynamics | 2022-11-03 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 79 |
| Measuring Progress on Scalable Oversight for Large Language Models Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-11-04Area: Scalable OversightCitations: 180 Tags: ai-safety, empirical, scalable-oversight | 2022-11-04 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 180 |
| Do Users Write More Insecure Code with AI Assistants? Dan Boneh, Deepak Kumar, Megha Srivastava, Neil Perry Published: 2022-11-07Area: Safety EvaluationCitations: 288 Tags: ai-safety, empirical, safety-evaluation | 2022-11-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 288 |
| Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion Models Bj枚rn Deiseroth, Kristian Kersting, Manuel Brack, Patrick Schramowski Published: 2022-11-09Area: Multimodal SafetyCitations: 480 Tags: ai-safety, empirical, multimodal-safety | 2022-11-09 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | 480 |
| Engineering Monosemanticity in Toy Models Adam S. Jermyn, Evan Hubinger, Nicholas Schiefer Published: 2022-11-16Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, empirical, mechanistic-interp | 2022-11-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 15 |
| Ignore Previous Prompt: Attack Techniques For Language Models F谩bio Perez, Ian Ribeiro Published: 2022-11-17Area: Adversarial RobustnessCitations: 675 Tags: adversarial-robustness, ai-safety, empirical | 2022-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 675 |
| Diagnostics for Deep Neural Networks with Automated Copy/Paste Attacks Dylan Hadfield-Menell, Kaivalya Hariharan, Stephen Casper Published: 2022-11-18Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-18 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 11 |
| Aging with GRACE: Lifelong Model Editing with Discrete Key-Value Adaptors Hamid Palangi, Marzyeh Ghassemi, Swami Sankaranarayanan, Thomas Hartvigsen Published: 2022-11-20Area: Model EditingCitations: 251 Tags: ai-safety, empirical, model-editing | 2022-11-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 251 |
| Solving Math Word Problems with Process- and Outcome-Based Feedback Antonia Creswell, Francis Song, Geoffrey Irving, Irina Higgins Published: 2022-11-25Area: Scalable OversightCitations: 591 Tags: ai-safety, empirical, scalable-oversight | 2022-11-25 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (94%) | 591 |
| Self-Destructing Models: Increasing the Costs of Harmful Dual Uses of Foundation Models Chelsea Finn, Christopher D. Manning, Dan Jurafsky, Eric Mitchell Published: 2022-11-27Area: Model EditingCitations: 65 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2022-11-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 65 |
| Discovering Latent Knowledge in Language Models Without Supervision Collin Burns, Dan Klein, Haotian Ye, Jacob Steinhardt Published: 2022-12-07Area: Representation AnalysisCitations: 571 Tags: ai-safety, empirical, representation-analysis | 2022-12-07 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (96%) | 571 |
| Editing Models with Task Arithmetic Ali Farhadi, Gabriel Ilharco, Hannaneh Hajishirzi, Ludwig Schmidt Published: 2022-12-08Area: Model EditingCitations: 828 Tags: ai-safety, empirical, model-editing | 2022-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 828 |
| Constitutional AI: Harmlessness from AI Feedback Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-12-15Area: Alignment TrainingCitations: 2490 Tags: ai-safety, alignment-training, empirical | 2022-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2490 |
| On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning Diyi Yang, Hongxin Zhang, Michael Bernstein, Omar Shaikh Published: 2022-12-15Area: Safety EvaluationCitations: 249 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2022-12-15 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 249 |