Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? Aashiq Muhamed, Aditi Raghunathan, Mona T. Diab, Virginia Smith Published: 2026-04-13Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-04-13 | cs.LG | ai-safety, cslg, interpretability, preprint | E5 / R3 (95%) | - |
| Distributed Interpretability and Control for Large Language Models Dev Arpan Desai, Shaoyi Huang, Zining Zhu Published: 2026-04-07Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-04-07 | cs.LG | ai-safety, cslg, interpretability, preprint | E5 / R3 (93%) | - |
| Detecting Multi-Agent Collusion Through Multi-Agent Interpretability Aaron Rose, Brandon Gary Kaplowitz, Carissa Cullen, Christian Schroeder de Witt Published: 2026-04-01Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-04-01 | cs.AI | ai-safety, csai, interpretability, preprint | E5 / R3 (94%) | - |
| Explainable AI for Blind and Low-Vision Users: Navigating Trust, Modality, and Interpretability in the Agentic Era Abu Noman Md Sakib, Protik Dey, Taslima Akter, Zijie Zhang Published: 2026-03-31Area: cs.HCCitations: - Tags: ai-safety, cshc, interpretability, preprint | 2026-03-31 | cs.HC | ai-safety, cshc, interpretability, preprint | E5 / R3 (94%) | - |
| From Density Matrices to Phase Transitions in Deep Learning: Spectral Early Warnings and Interpretability Guillaume Corlouer, Max Hennick Published: 2026-03-31Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-03-31 | cs.LG | ai-safety, cslg, interpretability, preprint | E5 / R3 (95%) | - |
| From Density Matrices to Phase Transitions in Deep Learning: Spectral Early Warnings and Interpretability Guillaume Corlouer, Max Hennick Published: 2026-03-31Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-03-31 | cs.LG | ai-safety, cslg, interpretability, preprint | E5 / R3 (96%) | - |
| Pitfalls in Evaluating Interpretability Agents Aaron Mueller, Antonio Torralba, Jacob Andreas, Nikhil Prakash Published: 2026-03-20Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-03-20 | cs.AI | ai-safety, csai, interpretability, preprint | E5 / R3 (96%) | - |
| Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models Benlin Liu, Jacob Feldman, Liwei Che, Michelle Hurst Published: 2026-03-19Area: cs.CVCitations: - Tags: ai-safety, cscv, interpretability, preprint | 2026-03-19 | cs.CV | ai-safety, cscv, interpretability, preprint | E5 / R3 (95%) | - |
| Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations Aakriti Kinra, Bhairavi Muralidharan, John Morgan, Namrata Elamaran Published: 2026-03-18Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-03-18 | cs.AI | ai-safety, csai, interpretability, preprint | E6 / R4 (98%) | - |
| Age Predictors Through the Lens of Generalization, Bias Mitigation, and Interpretability: Reflections on Causal Implications Alessandro Cellerino, Debdas Paul, Elisa Ferrari, Irene Gravili Published: 2026-03-17Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-03-17 | cs.LG | ai-safety, cslg, interpretability, preprint | E5 / R3 (92%) | - |
| Unpacking Interpretability: Human-Centered Criteria for Optimal Combinatorial Solutions David Steyrl, Dominik Pegler, Filip Melinscak, Frank J盲kel Published: 2026-03-09Area: cs.HCCitations: - Tags: ai-safety, cshc, interpretability, preprint | 2026-03-09 | cs.HC | ai-safety, cshc, interpretability, preprint | E5 / R3 (93%) | - |
| A Case Study on Concept Induction for Neuron-Level Interpretability in CNN Moumita Sen Sarma, Pascal Hitzler, Samatha Ereshi Akkamahadevi Published: 2026-02-27Area: cs.CVCitations: 10 Tags: ai-safety, cscv, interpretability, preprint | 2026-02-27 | cs.CV | ai-safety, cscv, interpretability, preprint | E9 / R8 (93%) | 10 |
| MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning Davis Brown, Gal Mishne, Helen Jenne, Henry Kvinge Published: 2026-02-24Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-02-24 | cs.LG | ai-safety, cslg, interpretability, preprint | E9 / R7 (91%) | - |
| Detecting Cybersecurity Threats by Integrating Explainable AI with SHAP Interpretability and Strategic Data Sampling Norrakith Srisumrith, Sunantha Sodsee Published: 2026-02-22Area: cs.CRCitations: 28 Tags: ai-safety, cscr, interpretability, preprint | 2026-02-22 | cs.CR | ai-safety, cscr, interpretability, preprint | E14 / R11 (95%) | 28 |
| RamanSeg: Interpretability-driven Deep Learning on Raman Spectra for Cancer Diagnosis Anna M眉hlig, Anna Xylander, Chris Tomy, David Pertzborn Published: 2026-02-20Area: eess.IVCitations: 15 Tags: ai-safety, eessiv, interpretability, preprint | 2026-02-20 | eess.IV | ai-safety, eessiv, interpretability, preprint | E10 / R6 (93%) | 15 |
| Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy Bianca Raimondi, Maurizio Gabbrielli Published: 2026-02-19Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-02-19 | cs.AI | ai-safety, csai, interpretability, preprint | E9 / R6 (93%) | - |
| Systematic Evaluation of Single-Cell Foundation Model Interpretability Reveals Attention Captures Co-Expression Rather Than Unique Regulatory Signal Ihor Kendiukhov Published: 2026-02-19Area: q-bio.GNCitations: 153 Tags: ai-safety, interpretability, preprint, q-biogn, safety-evaluation | 2026-02-19 | q-bio.GN | ai-safety, interpretability, preprint, q-biogn, safety-evaluation | E10 / R8 (91%) | 153 |
| Interpretability-by-Design with Accurate Locally Additive Models and Conditional Feature Effects Christos Diou, Dimitrios Kyriakopoulos, Dimitrios Rontogiannis, Giuseppe Casalicchio Published: 2026-02-18Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-02-18 | cs.LG | ai-safety, cslg, interpretability, preprint | E6 / R6 (91%) | - |
| Why Linear Interpretability Works: Invariant Subspaces as a Result of Architectural Constraints Andres Saurez, Dongsoo Har, Yousung Lee Published: 2026-02-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2026-02-10 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders Baosong Yang, Bingqing Jiang, Difan Zou, Lingpeng Kong Published: 2026-02-05Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2026-02-05 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Towards Worst-Case Guarantees with Scale-Aware Interpretability Alexander Stapleton, Andrew Mack, Anindita Maiti, Artemy Kolchinsky Published: 2026-02-05Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, interpretability, position | 2026-02-05 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, position | E5 / R3 (94%) | - |
| Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits Been Kim, Drew Proud, Mani Malek, Neha Kalibhat Published: 2026-01-23Area: Model EditingCitations: - Tags: ai-safety, empirical, interpretability, model-editing | 2026-01-23 | Model Editing | ai-safety, empirical, interpretability, model-editing | E5 / R3 (91%) | - |
| Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions Usman Naseem Published: 2026-01-21Area: Surveys & ReviewsCitations: 1 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2026-01-21 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E6 / R4 (96%) | 1 |
| Patterning: The Dual of Interpretability Daniel Murfet, George Wang Published: 2026-01-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2026-01-20 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R4 (95%) | - |
| SCALPEL: Selective Capability Ablation via Low-rank Parameter Editing for Large Language Model Interpretability Analysis Xufeng Duan, Zhenguang G. Cai, Zihao Fu Published: 2026-01-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2026-01-12 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (97%) | - |
| Interpreting Transformers Through Attention Head Intervention Mason Kadem, Rong Zheng Published: 2026-01-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, survey | 2026-01-07 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, survey | E5 / R3 (95%) | - |
| The Dead Salmons of AI Interpretability Fran莽ois Portet, Giada Dirupo, Maxime M茅loux, Maxime Peyrard Published: 2025-12-21Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-12-21 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E7 / R3 (93%) | 3 |
| Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability Ge Yan, Tsui-Wei (Lily) Weng, Tuomas Oikarinen Published: 2025-12-19Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-12-19 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers Adam Karvonen, Arnab Sen Sharma, Clement Dumas, Daniel Wen Published: 2025-12-17Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 2 |
| From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts? Aaron Mueller, Andrew Lee, Dhanya Sridhar, Ekdeep Singh Lubana Published: 2025-12-17Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 1 |