Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit Bahareh Tolooshams, Demba Ba, Ekdeep Singh Lubana, Thomas Fel Published: 2025-06-03Area: Mechanistic Interp.Citations: 16 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-03 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 16 |
| Evaluating Sparse Autoencoders: From Shallow Design to Matching Pursuit Bahareh Tolooshams, Demba Ba, Ekdeep Singh Lubana, Thomas Fel Published: 2025-06-05Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-06-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Evaluating Neuron Explanations: A Unified Framework with Sanity Checks Ge Yan, Tsui-Wei Weng, Tuomas Oikarinen Published: 2025-06-06Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (99%) | 7 |
| Transferring Linear Features Across Language Models With Model Stitching Alan Chen, Alessandro Stolfo, Ellie Pavlick, Jack Merullo Published: 2025-06-07Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| InverseScope: Scalable Activation Inversion for Interpreting Large Language Models Bin Dong, Yifan Luo, Zhennan Zhou Published: 2025-06-09Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-06-09 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Training Superior Sparse Autoencoders for Instruct Models Hamid Alinejad-Rokny, Haoran Ye, Jiaming Li, Jimmy Chih-Hsien Peng Published: 2025-06-09Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 1 |
| Know-MRI: A Knowledge Mechanisms Revealer&Interpreter for Large Language Models Boxuan Xing, Chenhao Yuan, Chenxiang Zhang, Chuhan Lang Published: 2025-06-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-06-10 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (93%) | - |
| NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment Jean-Noël Vittaut, Marie-Jeanne Lesot, Milan Bhan, Nicolas Chesneau Published: 2025-06-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-06-10 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Interpreting learned search: finding a transition model and value function in an RNN that plays Sokoban Aaron David Tucker, Adam Gleave, Adrià Garriga-Alonso, Mohammad Taufeeque Published: 2025-06-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-06-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | - |
| Decomposing MLP Activations into Interpretable Features via Semi-Nonnegative Matrix Factorization Atticus Geiger, Mor Geva, Or Shafran Published: 2025-06-12Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (96%) | 3 |
| Because we have LLMs, we Can and Should Pursue Agentic Interpretability Been Kim, John Hewitt, Neel Nanda, Noah Fiedel Published: 2025-06-13Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-13 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 9 |
| Attribution-guided Pruning for Compression, Circuit Discovery, and Targeted Correction in LLMs Maximilian Dreyer, Patrick Kahardipraja, Reduan Achtibat, Sayed Mohammad Vakilzadeh Hatefi Published: 2025-06-16Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 2 |
| Understanding Verbatim Memorization in LLMs Through Circuit Discovery Ilya Lasy, Peter Knees, Stefan Woltran Published: 2025-06-17Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R2 (96%) | 1 |
| Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework Anna Hedström, Kirill Bykov, Laura Kopf, Marina M.-C. Höhne Published: 2025-06-18Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 6 |
| Dense SAE Latents Are Features, Not Bugs Alessandro Stolfo, Ben Wu, Joshua Engels, Max Tegmark Published: 2025-06-18Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 7 |
| From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers Jingtong Su, Julia Kempe, Karen Ullrich Published: 2025-06-20Area: Mechanistic Interp.Citations: 3 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-06-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 3 |
| Sparse Feature Coactivation Reveals Composable Semantic Modules in Large Language Models Aman Taxali, Chandra Sripada, Joyce Chai, Mike Angstadt Published: 2025-06-22Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (93%) | 2 |
| Mechanistic Interpretability Needs Philosophy Anders Søgaard, Constanza Fierro, Filippos Stamatiou, Iwan Williams Published: 2025-06-23Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 3 |
| Cross-Layer Discrete Concept Discovery for Interpreting Language Models Ankur Garg, Hassan Sajjad, Samira Ebrahimi Kahou, Xuemin Yu Published: 2025-06-24Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| Measuring and Guiding Monosemanticity Björn Deiseroth, Felix Friedrich, Kristian Kersting, Manuel Brack Published: 2025-06-24Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2025-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (96%) | 3 |
| Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts Emma Pierson, Jon Kleinberg, Kenny Peng, Nikhil Garg Published: 2025-06-30Area: Mechanistic Interp.Citations: 13 Tags: ai-safety, mechanistic-interp, position | 2025-06-30 | Mechanistic Interp. | ai-safety, mechanistic-interp, position | E5 / R4 (93%) | 13 |
| SAFER: Probing Safety in Reward Models with Sparse Autoencoder Guojun Ma, Sihang Li, Tao Liang, Wei Shi Published: 2025-07-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-07-01 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (96%) | 2 |
| Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability Galvin Khara, Joachim Schaeffer, Luca Baroni, Marat Subkhankulov Published: 2025-07-03Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 4 |
| TRACE: Training and Inference-Time Interpretability Analysis for Language Models André Freitas, Danilo S. Carvalho, Nura Aljaafari Published: 2025-07-04Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-07-04 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| Can Interpretation Predict Behavior on Unseen Data? David Alvarez-Melis, Jenny Kaufmann, Martin Wattenberg, Naomi Saphra Published: 2025-07-08Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-08 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (92%) | 5 |
| Simple Mechanistic Explanations for Out-Of-Context Reasoning Atticus Wang, Joshua Engels, Neel Nanda, Oliver Clive-Griffin Published: 2025-07-10Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2025-07-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 3 |
| Evaluating SAE interpretability without explanations Gonçalo Paulo, Nora Belrose Published: 2025-07-11Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 1 |
| The Non-Linear Representation Dilemma: Is Causal Abstraction Enough for Mechanistic Interpretability? Denis Sutter, Julian Minder, Thomas Hofmann, Tiago Pimentel Published: 2025-07-11Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 11 |
| Compressed Computation: Dense Circuits in a Toy Model of the Universal-AND Problem Adam Newgas Published: 2025-07-13Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-07-13 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | - |
| Insights into a radiology-specialised multimodal large language model with sparse autoencoders Anton Schwaighofer, Daniel Coelho de Castro, Felix Meissen, Javier Alvarez-Valle Published: 2025-07-17Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-07-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (96%) | 1 |