Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable? Francois Portet, Maxime Meloux, Maxime Peyrard, Silviu Maniu Published: 2025-02-28Area: Mechanistic Interp.Citations: 14 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-02-28 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (94%) | 14 |
| From superposition to sparse codes: interpretable representations in neural networks Charles O'Neill, David Klindt, Harald Maurer, Nina Miolane Published: 2025-03-03Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, mechanistic-interp, safety-evaluation, theoretical | 2025-03-03 | Mechanistic Interp. | ai-safety, mechanistic-interp, safety-evaluation, theoretical | E5 / R3 (93%) | 7 |
| CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models Jiaxu Liu, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2025-03-08 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E5 / R4 (96%) | - |
| Mitigating Preference Hacking in Policy Optimization with Pessimism Adam Fisch, Alekh Agarwal, Christoph Dann, Dhawal Gupta Published: 2025-03-10Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, theoretical | 2025-03-10 | Alignment Training | ai-safety, alignment-training, theoretical | E6 / R3 (95%) | 3 |
| Policy Teaching via Data Poisoning in Learning from Human Preferences Adish Singla, Andi Nika, Debmalya Mandal, Goran Radanovi膰 Published: 2025-03-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2025-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 1 |
| Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality Adam Davies, Julia Hockenmaier, Marc E. Canby, Sewoong Lee Published: 2025-03-31Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, mechanistic-interp, theoretical | 2025-03-31 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (93%) | 2 |
| AI in a vat: Fundamental limits of efficient world modelling for agent sandboxing and interpretability Alexander Boyd, Fernando Rosas, Manuel Baltieri Published: 2025-04-06Area: Formal/TheoreticalCitations: 2 Tags: ai-safety, formaltheoretical, interpretability, theoretical | 2025-04-06 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, theoretical | E6 / R3 (93%) | 2 |
| How to evaluate control measures for LLM agents? A trajectory from today to superintelligence Buck Shlegeris, Geoffrey Irving, Mikita Balesni, Tomek Korbak Published: 2025-04-07Area: Agent SafetyCitations: 11 Tags: agent-safety, ai-safety, safety-evaluation, theoretical | 2025-04-07 | Agent Safety | agent-safety, ai-safety, safety-evaluation, theoretical | E5 / R3 (92%) | 11 |
| Towards Combinatorial Interpretability of Neural Computation Dan Alistarh, Micah Adler, Nir Shavit Published: 2025-04-10Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-04-10 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (93%) | 7 |
| Guillotine: Hypervisors for Isolating Malicious AIs James Mickens, Ravi Netravali, Sarah Radway Published: 2025-04-22Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, theoretical | 2025-04-22 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R4 (97%) | 1 |
| Scaling Laws For Scalable Oversight David D. Baek, Joshua Engels, Max Tegmark, Subhash Kantamneni Published: 2025-04-25Area: Scalable OversightCitations: 4 Tags: ai-safety, scalable-oversight, theoretical | 2025-04-25 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E7 / R3 (97%) | 4 |
| Representation Learning on a Random Lattice Aryeh Brill Published: 2025-04-28Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, mechanistic-interp, theoretical | 2025-04-28 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E6 / R3 (96%) | 1 |
| Characterizing AI Agents for Alignment and Governance Atoosa Kasirzadeh, Iason Gabriel Published: 2025-04-30Area: Agent SafetyCitations: 28 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-04-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R5 (95%) | 28 |
| A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i Kola Ayonrinde, Louis Jaburi Published: 2025-05-01Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-01 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R3 (95%) | 4 |
| Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii Kola Ayonrinde, Louis Jaburi Published: 2025-05-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-02 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | 2 |
| An Alignment Safety Case Sketch Based on Debate Benjamin Hilton, Geoffrey Irving, Jacob Pfau, Marie Davidsen Buhl Published: 2025-05-06Area: Scalable OversightCitations: 8 Tags: ai-safety, alignment-training, scalable-oversight, theoretical | 2025-05-06 | Scalable Oversight | ai-safety, alignment-training, scalable-oversight, theoretical | E5 / R3 (94%) | 8 |
| Access Controls Will Solve the Dual-Use Dilemma Ev啪en Wybitul Published: 2025-05-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-14 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 2 |
| Rethinking Circuit Completeness in Language Models: AND, OR, and ADDER Gates Hang Chen, Jiaying Zhu, Wenya Wang, Xinyu Yang Published: 2025-05-15Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, mechanistic-interp, theoretical | 2025-05-15 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E6 / R3 (94%) | 3 |
| SplInterp: Improving our Understanding and Training of Sparse Autoencoders Benjamin Macdowall Rynne, Javier Ideami, Jeremy Budd, Keith Duggar Published: 2025-05-17Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2025-05-17 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners Hiroshi Kera, Soichiro Kumano, Toshihiko Yamasaki Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 1 |
| An Example Safety Case for Safeguards Against Misuse Jonah Weinbaum, Joshua Clymer, Kimberly Mai, Robert Kirk Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-05-23 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| Scalable Valuation of Human Feedback through Provably Robust Model Alignment Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| The Origins of Representation Manifolds in Large Language Models Alexander Modell, Nick Whiteley, Patrick Rubin-Delanchy Published: 2025-05-23Area: Representation AnalysisCitations: 11 Tags: ai-safety, representation-analysis, theoretical | 2025-05-23 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (93%) | 11 |
| Concealment of Intent: A Game-Theoretic Analysis Abhishek Umrawal, Lav R. Varshney, Xinbo Wu Published: 2025-05-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | - |
| Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences? Kunhe Yang, Nika Haghtalab, Paul G枚lz Published: 2025-05-29Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 11 |
| From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models Haibo Jin, Haohan Wang, Man Luo, Peiran Wang Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | 3 |
| On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective Gengze Xu, Wei Yao, Yong Liu, Ziqiao Wang Published: 2025-05-30Area: Scalable OversightCitations: 1 Tags: ai-safety, scalable-oversight, theoretical | 2025-05-30 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E4 / R3 (93%) | 1 |
| Conformal Arbitrage: Risk-Controlled Balancing of Competing Objectives in Language Models Mohsen Bayati, William Overman Published: 2025-06-01Area: Formal/TheoreticalCitations: 3 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-01 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (96%) | 3 |
| Will artificial agents pursue power by default? Christian Tarsney Published: 2025-06-02Area: Formal/TheoreticalCitations: 1 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-02 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (92%) | 1 |
| The Limits of Predicting Agents from Behaviour Alexis Bellot, Jonathan Richens, Tom Everitt Published: 2025-06-03Area: Formal/TheoreticalCitations: 1 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-03 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (93%) | 1 |