Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models Boussad Addad, Katarzyna Kapusta, Thomas Winninger Published: 2025-03-08Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-03-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E6 / R3 (96%) | 3 |
| RouteSAE: Route Sparse Autoencoder to Interpret Large Language Models Guojun Ma, Mingyang Wan, Sihang Li, Tao Liang Published: 2025-03-11Area: Mechanistic Interp.Citations: 17 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-03-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R4 (95%) | 17 |
| SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability Adam Karvonen, Arthur Conmy, Callum McDougall, Can Rager Published: 2025-03-12Area: Mechanistic Interp.Citations: 62 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-03-12 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 62 |
| HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks Atticus Geiger, Christopher Potts, Jing Huang, Jiuding Sun Published: 2025-03-13Area: Mechanistic Interp.Citations: 8 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-03-13 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 8 |
| TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research Abir Harrasse, Amir Abdullah, Clement Neo, Dhruv Nathawani Published: 2025-03-17Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, dataset, interpretability, mechanistic-interp | 2025-03-17 | Mechanistic Interp. | ai-safety, dataset, interpretability, mechanistic-interp | E6 / R3 (95%) | 2 |
| Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models Mateusz Pach, Quentin Bouniot, Serge Belongie, Shyamgopal Karthik Published: 2025-04-03Area: Mechanistic Interp.Citations: 21 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-04-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (97%) | 21 |
| Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability Mohammad Mahdi Khalili, Vishnu Kabir Chhabra Published: 2025-04-05Area: Model EditingCitations: - Tags: ai-safety, empirical, interpretability, model-editing | 2025-04-05 | Model Editing | ai-safety, empirical, interpretability, model-editing | E7 / R3 (98%) | - |
| AI in a vat: Fundamental limits of efficient world modelling for agent sandboxing and interpretability Alexander Boyd, Fernando Rosas, Manuel Baltieri Published: 2025-04-06Area: Formal/TheoreticalCitations: 2 Tags: ai-safety, formaltheoretical, interpretability, theoretical | 2025-04-06 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, theoretical | E6 / R3 (93%) | 2 |
| Deceptive Automated Interpretability: Language Models Coordinating to Fool Oversight Systems Mateusz Dziemian, Natalia P茅rez-Campanero Antol铆n, Simon Lermen Published: 2025-04-10Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-04-10 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E6 / R3 (94%) | 4 |
| Towards Combinatorial Interpretability of Neural Computation Dan Alistarh, Micah Adler, Nir Shavit Published: 2025-04-10Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-04-10 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (93%) | 7 |
| MIB: A Mechanistic Interpretability Benchmark Aaron Mueller, Adam Belfki, Alessandro Stolfo, Amir Zur Published: 2025-04-17Area: Mechanistic Interp.Citations: 16 Tags: ai-safety, benchmark, interpretability, mechanistic-interp | 2025-04-17 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp | E6 / R3 (97%) | 16 |
| Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and Video Blake Aaron Richards, Danilo Bzdok, Edward Stevinson, Lee Sharkey Published: 2025-04-28Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-04-28 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (98%) | 11 |
| Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition Junping Zhang, Junxuan Wang, Qiong Tang, Rui Lin Published: 2025-04-29Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-04-29 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 2 |
| A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i Kola Ayonrinde, Louis Jaburi Published: 2025-05-01Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-01 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R3 (95%) | 4 |
| Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii Kola Ayonrinde, Louis Jaburi Published: 2025-05-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-02 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | 2 |
| Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors Christopher Potts, Diyi Yang, Jing Huang, Junyi Tao Published: 2025-05-17Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E8 / R3 (99%) | 4 |
| Towards eliciting latent knowledge from LLMs with mechanistic interpretability Bartosz Cywi艅ski, Emil Ryd, Neel Nanda, Senthooran Rajamanoharan Published: 2025-05-20Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-20 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | 6 |
| Interpretability Illusions with Sparse Autoencoders Aaron J. Li, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2025-05-21Area: Mechanistic Interp.Citations: 5 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 5 |
| GIM: Improved Interpretability for Large Language Models Jing Huang, Joakim Edin, Lars Maal酶e, Maria Maistro Published: 2025-05-23Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-23 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E7 / R3 (96%) | 1 |
| Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs Aashiq Muhamed, Kun Zhang, Lingjing Kong, Mona T. Diab Published: 2025-05-26Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | 2025-05-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | E5 / R3 (95%) | 6 |
| Towards Interpretability Without Sacrifice: Faithful Dense Layer Decomposition with Mixture of Decoders Grigorios G Chrysos, Ioannis Patras, James Oldfield, Mihalis A. Nicolaou Published: 2025-05-27Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 1 |
| Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders Daniil Gavrilov, Daniil Laptev, Nikita Balagansky, Vadim Kurochkin Published: 2025-05-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model Ilcahe Jung, Kangsan Kim, Kwanyong Park, Seanie Lee Published: 2025-06-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, benchmark, interpretability, multimodal-safety | 2025-06-05 | Multimodal Safety | ai-safety, benchmark, interpretability, multimodal-safety | E4 / R3 (98%) | 4 |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| InverseScope: Scalable Activation Inversion for Interpreting Large Language Models Bin Dong, Yifan Luo, Zhennan Zhou Published: 2025-06-09Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-06-09 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Because we have LLMs, we Can and Should Pursue Agentic Interpretability Been Kim, John Hewitt, Neel Nanda, Noah Fiedel Published: 2025-06-13Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-13 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 9 |
| Mechanistic Interpretability Needs Philosophy Anders S酶gaard, Constanza Fierro, Filippos Stamatiou, Iwan Williams Published: 2025-06-23Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 3 |
| Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability Galvin Khara, Joachim Schaeffer, Luca Baroni, Marat Subkhankulov Published: 2025-07-03Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 4 |
| TRACE: Training and Inference-Time Interpretability Analysis for Language Models Andr茅 Freitas, Danilo S. Carvalho, Nura Aljaafari Published: 2025-07-04Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-07-04 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| Can Interpretation Predict Behavior on Unseen Data? David Alvarez-Melis, Jenny Kaufmann, Martin Wattenberg, Naomi Saphra Published: 2025-07-08Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-08 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (92%) | 5 |