Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 94 papers (page 1 of 4)· 83 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AI Research Considerations for Human Existential Safety (ARCHES) Andrew Critch, David Krueger Published: 2020-05-30Area: Surveys & ReviewsCitations: 65 Tags: ai-safety, position, surveys-reviews | 2020-05-30 | Surveys & Reviews | ai-safety, position, surveys-reviews | E5 / R3 (97%) | 65 |
| Towards Falsifiable Interpretability Research Ari S. Morcos, Matthew L. Leavitt Published: 2020-10-22Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, interpretability, mechanistic-interp, position | 2020-10-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E6 / R4 (97%) | 74 |
| Open Problems in Cooperative AI Allan Dafoe, Edward Hughes, Joel Z. Leibo, Kate Larson Published: 2020-12-15Area: Agent SafetyCitations: 239 Tags: agent-safety, ai-safety, position | 2020-12-15 | Agent Safety | agent-safety, ai-safety, position | E6 / R5 (93%) | 239 |
| Unsolved Problems in ML Safety Dan Hendrycks, Jacob Steinhardt, John Schulman, Nicholas Carlini Published: 2021-09-28Area: Surveys & ReviewsCitations: 359 Tags: ai-safety, alignment-training, position, surveys-reviews | 2021-09-28 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R3 (95%) | 359 |
| Truthful AI: Developing and Governing AI That Does Not Lie Adam Bales, Avital Balwit, Luca Righetti, Lukas Finnveden Published: 2021-10-13Area: Alignment TrainingCitations: 140 Tags: ai-safety, alignment-training, position | 2021-10-13 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | 140 |
| X-Risk Analysis for AI Research Dan Hendrycks, Mantas Mazeika Published: 2022-06-13Area: Surveys & ReviewsCitations: 81 Tags: ai-safety, position, surveys-reviews | 2022-06-13 | Surveys & Reviews | ai-safety, position, surveys-reviews | E6 / R4 (96%) | 81 |
| Circumventing interpretability: How to defeat mind-readers Lee Sharkey Published: 2022-12-21Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, interpretability, position | 2022-12-21 | Deception & Failure | ai-safety, deception-failure, interpretability, position | E5 / R3 (93%) | 5 |
| Auditing Large Language Models: A Three-Layered Approach Hannah Rose Kirk, Jakob Mokander, Jonas Schuett, Luciano Floridi Published: 2023-02-16Area: Safety EvaluationCitations: 277 Tags: ai-safety, position, safety-evaluation | 2023-02-16 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (95%) | 277 |
| Natural Selection Favors AIs over Humans Dan Hendrycks Published: 2023-03-28Area: Agent SafetyCitations: 40 Tags: agent-safety, ai-safety, position | 2023-03-28 | Agent Safety | agent-safety, ai-safety, position | E4 / R3 (93%) | 40 |
| Model Evaluation for Extreme Risks Allan Dafoe, Been Kim, Ben Garfinkel, Daniel Kokotajlo Published: 2023-05-24Area: Safety EvaluationCitations: 201 Tags: ai-safety, alignment-training, position, safety-evaluation | 2023-05-24 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E5 / R4 (93%) | 201 |
| Deceptive Alignment Monitoring Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, position | 2023-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, position | E4 / R3 (95%) | 14 |
| Provably safe systems: the only path to controllable AGI Max Tegmark, Steve Omohundro Published: 2023-09-05Area: Formal/TheoreticalCitations: 38 Tags: ai-safety, formaltheoretical, interpretability, position | 2023-09-05 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, position | E7 / R4 (96%) | 38 |
| Deployment Corrections: An incident response framework for frontier AI models Joe O'Brien, Shaun Ee, Zoe Williams Published: 2023-09-30Area: Safety EvaluationCitations: 22 Tags: ai-safety, position, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (92%) | 22 |
| AI Systems of Concern Fazl Barez, Kayla Matteucci, Seán Ó hÉigeartaigh, Shahar Avin Published: 2023-10-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, position | 2023-10-09 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (95%) | 1 |
| Managing AI Risks in an Era of Rapid Progress Anca Dragan, Andrew Yao, Ashwin Acharya, Atılım Güneş Baydin Published: 2023-10-26Area: Surveys & ReviewsCitations: 80 Tags: ai-safety, position, surveys-reviews | 2023-10-26 | Surveys & Reviews | ai-safety, position, surveys-reviews | E5 / R3 (93%) | 80 |
| Towards Evaluating AI Systems for Moral Status Using Self-Reports Ethan Perez, Robert Long Published: 2023-11-14Area: Safety EvaluationCitations: 17 Tags: ai-safety, position, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R4 (93%) | 17 |
| Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models Alan Chan, Ben Bucknall, David Krueger, Herbie Bradley Published: 2023-12-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, position, safety-evaluation | 2023-12-22 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 7 |
| Black-Box Access is Insufficient for Rigorous AI Audits Alan Chan, Andreas Haupt, Benjamin Bucknall, Carson Ezell Published: 2024-01-25Area: Safety EvaluationCitations: 143 Tags: ai-safety, position, safety-evaluation | 2024-01-25 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (95%) | 143 |
| Real Sparks of Artificial Intelligence and the Importance of Inner Interpretability Alex Grzankowski Published: 2024-01-31Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-01-31 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E8 / R4 (94%) | 10 |
| Building Guardrails for Large Language Models Gaojie Jin, Jie Meng, Jinwei Hu, Ronghui Mu Published: 2024-02-02Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, position | 2024-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 74 |
| Challenges in Mechanistically Interpreting Model Representations James Dao, Satvik Golechha Published: 2024-02-06Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-02-06 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (93%) | 4 |
| LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper Daoyuan Wu, Ning Liu, Shuai Wang, Yang Liu Published: 2024-02-24Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, position | 2024-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 11 |
| Safety Cases: How to Justify the Safety of Advanced AI Systems David Krueger, Joshua Clymer, Nicholas Gabrieli, Thomas Larsen Published: 2024-03-15Area: Safety EvaluationCitations: 54 Tags: ai-safety, position, safety-evaluation | 2024-03-15 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (93%) | 54 |
| Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback Bob M. Jacobs, Emanuel Tewolde, Eric Pacuit, Hailey Schoelkopf Published: 2024-04-16Area: Alignment TrainingCitations: 69 Tags: ai-safety, alignment-training, position | 2024-04-16 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 69 |
| Towards Guaranteed Safe AI: A Framework for Ensuring Robust and Reliable AI Systems Alessandro Abate, Ben Goldhaber, Christian Szegedy, Clark Barrett Published: 2024-05-10Area: Formal/TheoreticalCitations: 102 Tags: ai-safety, formaltheoretical, position | 2024-05-10 | Formal/Theoretical | ai-safety, formaltheoretical, position | E5 / R4 (97%) | 102 |
| AI Risk Management Should Incorporate Both Safety and Security Arvind Narayanan, Bo Li, Boyi Wei, Chaowei Xiao Published: 2024-05-29Area: Surveys & ReviewsCitations: 20 Tags: adversarial-robustness, ai-safety, position, surveys-reviews | 2024-05-29 | Surveys & Reviews | adversarial-robustness, ai-safety, position, surveys-reviews | E5 / R4 (97%) | 20 |
| Position: An Inner Interpretability Framework for AI Inspired by Lessons from Cognitive Neuroscience David Poeppel, Federico Adolfi, Gemma Roig, Martina G. Vilas Published: 2024-06-03Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-06-03 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 10 |
| AI Alignment through Reinforcement Learning from Human Feedback? Contradictions and Limitations Adam Dahlgren Lindström, Dimitri Coelho Mollo, Íñigo Martínez de Rituerto de Troya, Lea Krause Published: 2024-06-26Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, position | 2024-06-26 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (95%) | 8 |
| UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI Eleni Triantafillou, Eugene Bagdasaryan, Guillermo Ortiz-Jimenez, Heidi Howard Published: 2024-06-27Area: Model EditingCitations: 50 Tags: ai-safety, model-editing, position | 2024-06-27 | Model Editing | ai-safety, model-editing, position | E5 / R3 (95%) | 50 |
| Evaluating AI Evaluation: Perils and Prospects John Burden Published: 2024-07-12Area: Safety EvaluationCitations: 16 Tags: ai-safety, position, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 16 |