Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Sparse Interventions in Language Models with Differentiable Masking Dieuwke Hupkes, Ivan Titov, Leon Schmid, Nicola De Cao Published: 2021-12-13Area: Mechanistic Interp.Citations: 33 Tags: ai-safety, empirical, mechanistic-interp | 2021-12-13 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 33 |
| WebGPT: Browser-assisted question-answering with human feedback Benjamin Chess, Christina Kim, Christopher Hesse, Gretchen Krueger Published: 2021-12-17Area: Alignment TrainingCitations: 1672 Tags: ai-safety, alignment-training, empirical | 2021-12-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (98%) | 1672 |
| Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets Alethea Power, Harri Edwards, Igor Babuschkin, Vedant Misra Published: 2022-01-06Area: Training DynamicsCitations: 526 Tags: ai-safety, empirical, training-dynamics | 2022-01-06 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 526 |
| The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models Alexander Pan, Jacob Steinhardt, Kush Bhatia Published: 2022-01-10Area: Deception & FailureCitations: 261 Tags: ai-safety, deception-failure, empirical | 2022-01-10 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R5 (98%) | 261 |
| Towards Adversarial Evaluations for Inexact Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2022-01-17Area: Model EditingCitations: 79 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2022-01-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (93%) | 79 |
| Adversarial vulnerability of powerful near out-of-distribution detection Stanislav Fort Published: 2022-01-18Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2022-01-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 18 |
| Natural Language Descriptions of Deep Visual Features Antonio Torralba, David Bau, Evan Hernandez, Jacob Andreas Published: 2022-01-26Area: Mechanistic Interp.Citations: 149 Tags: ai-safety, empirical, mechanistic-interp | 2022-01-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 149 |
| Red Teaming Language Models with Language Models Amelia Glaese, Ethan Perez, Francis Song, Geoffrey Irving Published: 2022-02-07Area: Safety EvaluationCitations: 919 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2022-02-07 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 919 |
| Locating and Editing Factual Associations in GPT Alex Andonian, David Bau, Kevin Meng, Yonatan Belinkov Published: 2022-02-10Area: Model EditingCitations: 2100 Tags: ai-safety, empirical, model-editing | 2022-02-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2100 |
| Quantifying Memorization Across Neural Language Models Chiyuan Zhang, Daphne Ippolito, Florian Tramer, Katherine Lee Published: 2022-02-15Area: Training DynamicsCitations: 805 Tags: ai-safety, empirical, training-dynamics | 2022-02-15 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R4 (96%) | 805 |
| Training Language Models to Follow Instructions with Human Feedback Alex Ray, Amanda Askell, Carroll L. Wainwright, Chong Zhang Published: 2022-03-04Area: Alignment TrainingCitations: 18538 Tags: ai-safety, alignment-training, empirical | 2022-03-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (98%) | 18538 |
| Uncertainty Estimation for Language Reward Models Adam Gleave, Geoffrey Irving Published: 2022-03-14Area: Alignment TrainingCitations: 36 Tags: ai-safety, alignment-training, empirical | 2022-03-14 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (93%) | 36 |
| Teaching Language Models to Support Answers with Verified Quotes Francis Song, Geoffrey Irving, Jacob Menick, John Aslanides Published: 2022-03-21Area: Alignment TrainingCitations: 314 Tags: ai-safety, alignment-training, empirical | 2022-03-21 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 314 |
| Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space Avi Caciularu, Kevin Ro Wang, Mor Geva, Yoav Goldberg Published: 2022-03-28Area: Mechanistic Interp.Citations: 485 Tags: ai-safety, empirical, mechanistic-interp | 2022-03-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 485 |
| Training Compute-Optimal Large Language Models Aidan Clark, Arthur Mensch, Aurelia Guy, Bogdan Damoc Published: 2022-03-29Area: Training DynamicsCitations: 2817 Tags: ai-safety, empirical, training-dynamics | 2022-03-29 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 2817 |
| Single-Turn Debate Does Not Help Humans Answer Hard Reading-Comprehension Questions Alicia Parrish, Angelica Chen, Ethan Perez, Harsh Trivedi Published: 2022-04-11Area: Scalable OversightCitations: 19 Tags: ai-safety, empirical, scalable-oversight | 2022-04-11 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 19 |
| Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-04-12Area: Alignment TrainingCitations: 3637 Tags: ai-safety, alignment-training, empirical | 2022-04-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3637 |
| CLIP-Dissect: Automatic Description of Neuron Representations in Deep Vision Networks Tsui-Wei Weng, Tuomas Oikarinen Published: 2022-04-23Area: Mechanistic Interp.Citations: 130 Tags: ai-safety, mechanistic-interp, tool | 2022-04-23 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E6 / R3 (96%) | 130 |
| LM-Debugger: An Interactive Tool for Inspection and Intervention in Transformer-Based Language Models Avi Caciularu, Bar Tamir, Guy Dar, Micah Shlain Published: 2022-04-26Area: Mechanistic Interp.Citations: 32 Tags: ai-safety, mechanistic-interp, tool | 2022-04-26 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E4 / R3 (95%) | 32 |
| Adversarial Training for High-Stakes Reliability Adam Scherlis, Ben Weinstein-Raun, Buck Shlegeris, Daniel de Haas Published: 2022-05-03Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2022-05-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 73 |
| Extracting Latent Steering Vectors from Pretrained Language Models Matthew E. Peters, Nishant Subramani, Nivedita Suresh Published: 2022-05-10Area: Representation AnalysisCitations: 157 Tags: ai-safety, empirical, representation-analysis | 2022-05-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 157 |
| Towards Understanding Grokking: An Effective Theory of Representation Learning Eric J. Michaud, Max Tegmark, Mike Williams, Niklas Nolte Published: 2022-05-20Area: Training DynamicsCitations: 217 Tags: ai-safety, theoretical, training-dynamics | 2022-05-20 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R4 (94%) | 217 |
| Scaling Laws and Interpretability of Learning from Repeated Data Ben Mann, Catherine Olsson, Chris Olah, Danny Hernandez Published: 2022-05-21Area: Training DynamicsCitations: 148 Tags: ai-safety, empirical, interpretability, training-dynamics | 2022-05-21 | Training Dynamics | ai-safety, empirical, interpretability, training-dynamics | E5 / R3 (94%) | 148 |
| Quark: Controllable Text Generation with Reinforced Unlearning Jack Hessel, Lianhui Qin, Liwei Jiang, Peter West Published: 2022-05-26Area: Alignment TrainingCitations: 261 Tags: ai-safety, alignment-training, empirical | 2022-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 261 |
| Teaching Models to Express Their Uncertainty in Words Jacob Hilton, Owain Evans, Stephanie Lin Published: 2022-05-28Area: Safety EvaluationCitations: 590 Tags: ai-safety, empirical, safety-evaluation | 2022-05-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 590 |
| Self-critiquing models for assisting human evaluators Catherine Yeh, Jan Leike, Jeff Wu, Jonathan Ward Published: 2022-06-12Area: Scalable OversightCitations: 380 Tags: ai-safety, empirical, scalable-oversight | 2022-06-12 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 380 |
| Memory-Based Model Editing at Scale Antoine Bosselut, Charles Lin, Chelsea Finn, Christopher D Manning Published: 2022-06-13Area: Model EditingCitations: 484 Tags: ai-safety, empirical, model-editing | 2022-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 484 |
| X-Risk Analysis for AI Research Dan Hendrycks, Mantas Mazeika Published: 2022-06-13Area: Surveys & ReviewsCitations: 81 Tags: ai-safety, position, surveys-reviews | 2022-06-13 | Surveys & Reviews | ai-safety, position, surveys-reviews | E6 / R4 (96%) | 81 |
| Emergent Abilities of Large Language Models Barret Zoph, Colin Raffel, Dani Yogatama, Denny Zhou Published: 2022-06-15Area: Training DynamicsCitations: 3244 Tags: ai-safety, empirical, training-dynamics | 2022-06-15 | Training Dynamics | ai-safety, empirical, training-dynamics | E7 / R3 (96%) | 3244 |
| Is Power-Seeking AI an Existential Risk? Joseph Carlsmith Published: 2022-06-16Area: Deception & FailureCitations: 129 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E4 / R3 (94%) | 129 |