Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Bare Minimum Mitigations for Autonomous AI Development Chaochao Lu, Chris Cundy, Conor McGurk, Fynn Heide Published: 2025-04-21Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, position | 2025-04-21 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (94%) | 1 |
| An Approach to Technical AGI Safety and Security Alexander Matt Turner, Alex Irpan, Allan Dafoe, Anca Dragan Published: 2025-04-02Area: Surveys & ReviewsCitations: 35 Tags: ai-safety, alignment-training, position, surveys-reviews | 2025-04-02 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E5 / R3 (96%) | 35 |
| What Makes an Evaluation Useful? Common Pitfalls and Best Practices Dan Lahav, Gil Gekker, Meirav Segal, Omer Nevo Published: 2025-03-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, position, safety-evaluation | 2025-03-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (91%) | 1 |
| Securing External Deeper-than-black-box GPAI Evaluations Alejandro Tlaie, Jimmy Farrell Published: 2025-03-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, position, safety-evaluation | 2025-03-10 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 3 |
| Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization HyunJin Kim, James Evans, Jing Yao, JinYeong Bak Published: 2025-03-08Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-03-08 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E6 / R3 (93%) | - |
| LLM-Safety Evaluations Lack Robustness Gauthier Gidel, Leo Schwinn, Simon Geisler, Sophie Xhonneux Published: 2025-03-04Area: Safety EvaluationCitations: 12 Tags: ai-safety, position, safety-evaluation | 2025-03-04 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 12 |
| Bridge the Gaps between Machine Unlearning and AI Regulation Bill Marino, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-02-18Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, position | 2025-02-18 | Model Editing | ai-safety, model-editing, position | E5 / R3 (95%) | 5 |
| Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives Gauthier Gidel, Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann Published: 2025-02-17Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, position | 2025-02-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, position | E4 / R3 (94%) | 7 |
| You Are What You Eat: AI Alignment Requires Understanding How Data Shapes Structure and Generalisation Alexander Gietelink Oldenziel, Daniel Murfet, George Wang, Jesse Hoogland Published: 2025-02-08Area: Formal/TheoreticalCitations: 9 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-02-08 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E5 / R4 (96%) | 9 |
| Position: Editing Large Language Models Poses Serious Safety Risks Christin Seifert, Daniel Braun, Jorg Schlotterer, Paul Youssef Published: 2025-02-05Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, position | 2025-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E6 / R3 (95%) | 15 |
| Safety Cases: A Scalable Approach to Frontier AI Safety Benjamin Hilton, Geoffrey Irving, Marie Davidsen Buhl, Tomek Korbak Published: 2025-02-05Area: Scalable OversightCitations: 10 Tags: ai-safety, position, scalable-oversight | 2025-02-05 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R3 (93%) | 10 |
| Adversarial ML Problems Are Getting Harder to Solve and to Evaluate Florian Tram猫r, Javier Rando, Jie Zhang, Nicholas Carlini Published: 2025-02-04Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, position | 2025-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (94%) | 24 |
| Building Bridges, Not Walls: Advancing Interpretability by Unifying Feature, Data, and Model Component Attribution Hima Lakkaraju, Shichang Zhang, Tessa Han, Usha Bhalla Published: 2025-01-31Area: Surveys & ReviewsCitations: 3 Tags: ai-safety, interpretability, position, surveys-reviews | 2025-01-31 | Surveys & Reviews | ai-safety, interpretability, position, surveys-reviews | E5 / R3 (97%) | 3 |
| A Sketch of an AI Control Safety Case Benjamin Hilton, Buck Shlegeris, Geoffrey Irving, Joshua Clymer Published: 2025-01-28Area: Agent SafetyCitations: 22 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-01-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E6 / R4 (93%) | 22 |
| If It's Nice, Do It Twice: We Should Try Iterative Corpus Curation Robin Young Published: 2025-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, position | 2025-01-25 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | - |
| OpenAI's Approach to External Red Teaming for AI Models and Systems Lama Ahmad, Michael Lampe, Pamela Mishkin, Sandhini Agarwal Published: 2025-01-24Area: Safety EvaluationCitations: 33 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E6 / R4 (97%) | 33 |
| Episodic Memory in AI Agents Poses Risks that Should be Studied and Mitigated Chad DeChant Published: 2025-01-20Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, position | 2025-01-20 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (96%) | 8 |
| Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity Adam Oberman, David Williams-King, Linh Le, Yoshua Bengio Published: 2025-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, position | 2025-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E6 / R4 (93%) | - |
| Infrastructure for AI Agents Alan Chan, Elija Perrier, Gillian K. Hadfield, Kevin Wei Published: 2025-01-17Area: Agent SafetyCitations: 24 Tags: agent-safety, ai-safety, position | 2025-01-17 | Agent Safety | agent-safety, ai-safety, position | E6 / R4 (96%) | 24 |
| Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research Abigail Z. Jacobs, A. Feder Cooper, Alexandra Chouldechova, Amy B. Cyphert Published: 2024-12-09Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, position | 2024-12-09 | Model Editing | ai-safety, model-editing, position | E5 / R3 (94%) | 2 |
| What AI evaluations for preventing catastrophic risks can and cannot do Lisa Thiergart, Peter Barnett Published: 2024-11-26Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, position, safety-evaluation | 2024-11-26 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E6 / R3 (95%) | 3 |
| Safety case template for frontier AI: A cyber inability argument Arthur Goemans, Benjamin Hilton, Geoffrey Irving, Jessica Wang Published: 2024-11-12Area: Safety EvaluationCitations: 26 Tags: ai-safety, position, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (96%) | 26 |
| Towards Evaluations-Based Safety Cases for AI Scheming Alexander Meinke, Bilal Chughtai, Buck Shlegeris, Charlotte Stix Published: 2024-10-29Area: Safety EvaluationCitations: 25 Tags: ai-safety, position, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (94%) | 25 |
| Safety Cases for Frontier AI Gaurav Sett, Jonas Schuett, Leonie Koessler, Marie Davidsen Buhl Published: 2024-10-28Area: Safety EvaluationCitations: 23 Tags: ai-safety, position, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, position, safety-evaluation | E4 / R3 (96%) | 23 |
| Mechanistic? Naomi Saphra, Sarah Wiegreffe Published: 2024-10-07Area: Surveys & ReviewsCitations: 38 Tags: ai-safety, interpretability, position, surveys-reviews | 2024-10-07 | Surveys & Reviews | ai-safety, interpretability, position, surveys-reviews | E5 / R3 (94%) | 38 |
| Position: LLM Unlearning Benchmarks are Weak Measures of Progress Neil Kale, Pratiksha Thaker, Shengyuan Hu, Virginia Smith Published: 2024-10-03Area: Safety EvaluationCitations: 45 Tags: ai-safety, position, safety-evaluation | 2024-10-03 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (97%) | 45 |
| Beyond Preferences in AI Alignment Hal Ashton, Matija Franklin, Micah Carroll, Tan Zhi-Xuan Published: 2024-08-30Area: Alignment TrainingCitations: 44 Tags: ai-safety, alignment-training, position | 2024-08-30 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 44 |
| Reasons to Doubt the Impact of AI Risk Evaluations Gabriel Mukobi Published: 2024-08-05Area: Safety EvaluationCitations: 6 Tags: ai-safety, position, safety-evaluation | 2024-08-05 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (95%) | 6 |
| On the Limitations and Prospects of Machine Unlearning for Generative AI Heng Chang, Jiangnan Ye, Lianzhe Wang, Shiji Zhou Published: 2024-08-01Area: Model EditingCitations: 14 Tags: ai-safety, model-editing, position, safety-evaluation | 2024-08-01 | Model Editing | ai-safety, model-editing, position, safety-evaluation | E5 / R4 (96%) | 14 |
| Supertrust foundational alignment: mutual trust must replace permanent control for safe superintelligence James M. Mazzu Published: 2024-07-29Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, position | 2024-07-29 | Alignment Training | ai-safety, alignment-training, position | E6 / R3 (93%) | 2 |