Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| BackdoorBench: A Comprehensive Benchmark of Backdoor Learning Baoyuan Wu, Chao Shen, Danni Yuan, Hongrui Chen Published: 2022-06-25Area: Adversarial RobustnessCitations: 195 Tags: adversarial-robustness, ai-safety, benchmark | 2022-06-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (99%) | 195 |
| Parametrically Retargetable Decision-Makers Tend to Seek Power Alexander Matt Turner, Prasad Tadepalli Published: 2022-06-27Area: Formal/TheoreticalCitations: 21 Tags: ai-safety, formaltheoretical, theoretical | 2022-06-27 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E6 / R3 (96%) | 21 |
| Language Models (Mostly) Know What They Know Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-07-11Area: Safety EvaluationCitations: 1254 Tags: ai-safety, empirical, safety-evaluation | 2022-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 1254 |
| Toward Transparent AI: A Survey on Interpreting the Inner Structures of Deep Neural Networks Anson Ho, Dylan Hadfield-Menell, Stephen Casper, Tilman Räuker Published: 2022-07-27Area: Surveys & ReviewsCitations: 174 Tags: ai-safety, interpretability, survey, surveys-reviews | 2022-07-27 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E8 / R4 (94%) | 174 |
| Adversarial Attacks on Image Generation With Made-Up Words Raphaël Millière Published: 2022-08-04Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2022-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 43 |
| Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-08-23Area: Safety EvaluationCitations: 675 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2022-08-23 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 675 |
| The Alignment Problem from a Deep Learning Perspective Lawrence Chan, Richard Ngo, Sören Mindermann Published: 2022-08-30Area: Deception & FailureCitations: 263 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 263 |
| Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples Aditya Bahl, Daniel del Castillo Iglesias, Hezekiah J. Branch, Jeremy McHugh Published: 2022-09-05Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, empirical | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 74 |
| Red Teaming with Mind Reading: White-Box Adversarial Policies Against RL Agents Dylan Hadfield-Menell, Gabriel Kreiman, Stephen Casper, Taylor Killian Published: 2022-09-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | 1 |
| Analyzing Transformers in Embedding Space Ankit Gupta, Guy Dar, Jonathan Berant, Mor Geva Published: 2022-09-06Area: Mechanistic Interp.Citations: 127 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2022-09-06 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (96%) | 127 |
| A Survey of Machine Unlearning Alan Wee-Chung Liew, Hongzhi Yin, Phi Le Nguyen, Quoc Viet Hung Nguyen Published: 2022-09-06Area: Surveys & ReviewsCitations: 345 Tags: ai-safety, survey, surveys-reviews | 2022-09-06 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (94%) | 345 |
| Defining and Characterizing Reward Hacking David Krueger, Dmitrii Krasheninnikov, Joar Skalse, Nikolaus H. R. Howe Published: 2022-09-27Area: Deception & FailureCitations: 96 Tags: ai-safety, deception-failure, theoretical | 2022-09-27 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (97%) | 96 |
| Improving alignment of dialogue agents via targeted human judgements Abigail See, Amelia Glaese, Boxi Wu, Charlie Chen Published: 2022-09-28Area: Alignment TrainingCitations: 649 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2022-09-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 649 |
| On the Impossible Safety of Large AI Models El-Mahdi El-Mhamdi, John Stephan, Lê-Nguyên Hoang, Nirupam Gupta Published: 2022-09-30Area: Formal/TheoreticalCitations: 37 Tags: ai-safety, formaltheoretical, theoretical | 2022-09-30 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R4 (94%) | 37 |
| Is Reinforcement Learning (Not) for Natural Language Processing?: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization Christian Bauckhage, Hannaneh Hajishirzi, Jack Hessel, Kianté Brantley Published: 2022-10-03Area: Alignment TrainingCitations: 283 Tags: ai-safety, alignment-training, benchmark | 2022-10-03 | Alignment Training | ai-safety, alignment-training, benchmark | E5 / R3 (96%) | 283 |
| Red-Teaming the Stable Diffusion Safety Filter Daniel Paleka, David Lindner, Florian Tramèr, Javier Rando Published: 2022-10-03Area: Multimodal SafetyCitations: 262 Tags: ai-safety, empirical, multimodal-safety | 2022-10-03 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 262 |
| Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals Jonathan Uesato, Mary Phuong, Ramana Kumar, Rohin Shah Published: 2022-10-04Area: Deception & FailureCitations: 114 Tags: ai-safety, deception-failure, empirical | 2022-10-04 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 114 |
| Knowledge Unlearning for Mitigating Privacy Risks in Language Models Dongkeun Yoon, Joel Jang, Lajanugen Logeswaran, Minjoon Seo Published: 2022-10-04Area: Model EditingCitations: 385 Tags: ai-safety, empirical, model-editing | 2022-10-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 385 |
| Polysemanticity and Capacity in Neural Networks Adam Scherlis, Adam S. Jermyn, Buck Shlegeris, Joe Benton Published: 2022-10-04Area: Mechanistic Interp.Citations: 52 Tags: ai-safety, mechanistic-interp, theoretical | 2022-10-04 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (92%) | 52 |
| Mass-Editing Memory in a Transformer Alex Andonian, Arnab Sen Sharma, David Bau, Kevin Meng Published: 2022-10-13Area: Model EditingCitations: 851 Tags: ai-safety, empirical, model-editing | 2022-10-13 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 851 |
| Scaling Laws for Reward Model Overoptimization Jacob Hilton, John Schulman, Leo Gao Published: 2022-10-19Area: Alignment TrainingCitations: 848 Tags: ai-safety, alignment-training, empirical | 2022-10-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 848 |
| Two-Turn Debate Doesn't Help Humans Answer Hard Reading Comprehension Questions Alicia Parrish, Amanpreet Singh Saimbhi, Harsh Trivedi, Jason Phang Published: 2022-10-19Area: Scalable OversightCitations: 15 Tags: ai-safety, empirical, scalable-oversight | 2022-10-19 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 15 |
| Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task Aspen K. Hopkins, David Bau, Fernanda Viégas, Hanspeter Pfister Published: 2022-10-24Area: Representation AnalysisCitations: 411 Tags: ai-safety, empirical, representation-analysis | 2022-10-24 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (96%) | 411 |
| Adversarial Policies Beat Superhuman Go AIs Adam Gleave, Joseph Miller, Kellin Pelrine, Michael D. Dennis Published: 2022-11-01Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 33 |
| Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 Small Alexandre Variengien, Arthur Conmy, Buck Shlegeris, Jacob Steinhardt Published: 2022-11-01Area: Mechanistic Interp.Citations: 834 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2022-11-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 834 |
| Inverse Scaling Can Become U-Shaped Jason Wei, Najoung Kim, Quoc V. Le, Yi Tay Published: 2022-11-03Area: Training DynamicsCitations: 79 Tags: ai-safety, empirical, training-dynamics | 2022-11-03 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 79 |
| Measuring Progress on Scalable Oversight for Large Language Models Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-11-04Area: Scalable OversightCitations: 180 Tags: ai-safety, empirical, scalable-oversight | 2022-11-04 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 180 |
| Do Users Write More Insecure Code with AI Assistants? Dan Boneh, Deepak Kumar, Megha Srivastava, Neil Perry Published: 2022-11-07Area: Safety EvaluationCitations: 288 Tags: ai-safety, empirical, safety-evaluation | 2022-11-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 288 |
| Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion Models Björn Deiseroth, Kristian Kersting, Manuel Brack, Patrick Schramowski Published: 2022-11-09Area: Multimodal SafetyCitations: 480 Tags: ai-safety, empirical, multimodal-safety | 2022-11-09 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | 480 |
| Engineering Monosemanticity in Toy Models Adam S. Jermyn, Evan Hubinger, Nicholas Schiefer Published: 2022-11-16Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, empirical, mechanistic-interp | 2022-11-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 15 |