Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 94 papers (page 1 of 4)路 5267 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Position: Capability Control Should be a Separate Goal From Alignment Adrian Weller, David Krueger, Eleni Triantafillou, Shoaib Ahmed Siddiqui Published: 2026-02-05Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2026-02-05 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (94%) | - |
| Towards Worst-Case Guarantees with Scale-Aware Interpretability Alexander Stapleton, Andrew Mack, Anindita Maiti, Artemy Kolchinsky Published: 2026-02-05Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, interpretability, position | 2026-02-05 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, position | E5 / R3 (94%) | - |
| Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World Davood Soleymanzadeh, Fan Fei, Joonkyung Kim, Minghui Zheng Published: 2026-02-03Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, position | 2026-02-03 | Agent Safety | agent-safety, ai-safety, position | E5 / R4 (93%) | - |
| To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack Ruijie Meng, Terry Yue Zhuo, Wenbo Guo, Yangruibo Ding Published: 2026-02-01Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, position | 2026-02-01 | Agent Safety | agent-safety, ai-safety, position | E5 / R4 (94%) | - |
| Multi-Agent Systems Should be Treated as Principal-Agent Problems Mihaela van der Schaar, Paulius Rauba, Simonas Cepenas Published: 2026-01-30Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, position | 2026-01-30 | Agent Safety | agent-safety, ai-safety, position | E5 / R4 (94%) | - |
| Expanding External Access To Frontier AI Models For Dangerous Capability Evaluations Aidan Homewood, Alejandro Tlaie, Jacob Charnock, Kyle O'Brien Published: 2026-01-17Area: Safety EvaluationCitations: - Tags: ai-safety, position, safety-evaluation | 2026-01-17 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (96%) | - |
| The Dead Salmons of AI Interpretability Fran莽ois Portet, Giada Dirupo, Maxime M茅loux, Maxime Peyrard Published: 2025-12-21Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-12-21 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E7 / R3 (93%) | 3 |
| Distributional AGI Safety Julian Jacobs, Matija Franklin, Nenad Toma拧ev, S茅bastien Krier Published: 2025-12-18Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, position | 2025-12-18 | Agent Safety | agent-safety, ai-safety, position | E4 / R3 (92%) | 4 |
| AI & Human Co-Improvement for Safer Co-Superintelligence Jakob Foerster, Jason Weston Published: 2025-12-05Area: Scalable OversightCitations: 4 Tags: ai-safety, position, scalable-oversight | 2025-12-05 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R4 (96%) | 4 |
| Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective Anne Lauscher, Jae Hee Lee, Stefano V. Albrecht Published: 2025-12-04Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | 2025-12-04 | Agent Safety | agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | E5 / R3 (94%) | 1 |
| Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value Andreas Haupt, Andrew Koh, Atoosa Kasirzadeh, Atrisha Sarkar Published: 2025-12-03Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, position | 2025-12-03 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 2 |
| Systems Security Foundations for Agentic Computing Ashish Hooda, Earlence Fernandes, Johann Rehberger, Khawaja Shams Published: 2025-12-01Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, position | 2025-12-01 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (96%) | 2 |
| Difficulties with Evaluating a Deception Detector for AIs Bilal Chughtai, Lewis Smith, Neel Nanda Published: 2025-11-27Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, position | 2025-11-27 | Deception & Failure | ai-safety, deception-failure, position | E5 / R3 (95%) | 1 |
| Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment Boxuan Wang, Guangliang Cheng, Jinwei Hu, Lokesh Singh Published: 2025-10-15Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, position | 2025-10-15 | Agent Safety | agent-safety, ai-safety, alignment-training, position | E4 / R3 (92%) | 4 |
| Regulating the Agency of LLM-based Agents Joshua Joseph, Se谩n Boddy Published: 2025-09-25Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, position | 2025-09-25 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (95%) | - |
| From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming Anusha Sinha, Hoda Heidari, James Lucassen, Keltin Grimes Published: 2025-09-14Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, safety-evaluation | 2025-09-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 2 |
| Towards Integrated Alignment Ben Y. Reis, William La Cava Published: 2025-08-08Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2025-08-08 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (93%) | - |
| Chain-of-Thought Monitorability: A New and Fragile Opportunity for AI Safety Alan Cooney, Aleksander Madry, Allan Dafoe, Anca Dragan Published: 2025-07-15Area: Scalable OversightCitations: 88 Tags: ai-safety, position, scalable-oversight | 2025-07-15 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R4 (95%) | 88 |
| Giving AI Agents Access to Cryptocurrency and Smart Contracts Creates New Vectors of AI Harm Ari Juels, Bill Marino Published: 2025-07-11Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, position | 2025-07-11 | Agent Safety | agent-safety, ai-safety, position | E6 / R3 (96%) | 2 |
| Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts Emma Pierson, Jon Kleinberg, Kenny Peng, Nikhil Garg Published: 2025-06-30Area: Mechanistic Interp.Citations: 13 Tags: ai-safety, mechanistic-interp, position | 2025-06-30 | Mechanistic Interp. | ai-safety, mechanistic-interp, position | E5 / R4 (93%) | 13 |
| Mechanistic Interpretability Needs Philosophy Anders S酶gaard, Constanza Fierro, Filippos Stamatiou, Iwan Williams Published: 2025-06-23Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 3 |
| Out of Control - Why Alignment Needs Formal Control Theory (and an Alignment Control Stack) Elija Perrier Published: 2025-06-21Area: Formal/TheoreticalCitations: 2 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-06-21 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E4 / R2 (94%) | 2 |
| Because we have LLMs, we Can and Should Pursue Agentic Interpretability Been Kim, John Hewitt, Neel Nanda, Noah Fiedel Published: 2025-06-13Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-13 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 9 |
| Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models Boqing Gong, Yuwen Tan Published: 2025-06-12Area: Model EditingCitations: 1 Tags: ai-safety, model-editing, position | 2025-06-12 | Model Editing | ai-safety, model-editing, position | E4 / R3 (95%) | 1 |
| A Red Teaming Roadmap Towards System-Level Safety Christina Q. Knight, Jeremy Kritz, Julian Michael, Willow E. Primack Published: 2025-05-30Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-05-30 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E5 / R3 (92%) | 2 |
| LLM Agents Should Employ Security Principles Elisa Bertino, Kaiyuan Zhang, Ninghui Li, Pin-Yu Chen Published: 2025-05-29Area: Agent SafetyCitations: 13 Tags: agent-safety, ai-safety, position | 2025-05-29 | Agent Safety | agent-safety, ai-safety, position | E6 / R4 (94%) | 13 |
| Seven Security Challenges That Must be Solved in Cross-domain Multi-agent LLM Systems Chuan Xiao, Jiseong Jeong, Makoto Onizuka, Ronny Ko Published: 2025-05-28Area: Agent SafetyCitations: 10 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-05-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E7 / R3 (96%) | 10 |
| Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs Aashiq Muhamed, Kun Zhang, Lingjing Kong, Mona T. Diab Published: 2025-05-26Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | 2025-05-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | E5 / R3 (95%) | 6 |
| What is AI safety? What do we want it to be? Cameron Domenico Kirk-Giannini, Jacqueline Harding Published: 2025-05-05Area: Surveys & ReviewsCitations: 1 Tags: ai-safety, position, surveys-reviews | 2025-05-05 | Surveys & Reviews | ai-safety, position, surveys-reviews | E5 / R3 (95%) | 1 |
| Super Co-alignment of Human and AI for Sustainable Symbiotic Society Bing Han, Boyuan Chen, Chao Liu, Dongcheng Zhao Published: 2025-04-24Area: Scalable OversightCitations: 3 Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-04-24 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E5 / R3 (94%) | 3 |