Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 211-236 of 236 papers (page 8 of 8)路 73 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent Soheil Feizi, Sriram Balasubramanian Published: 2026-07-17Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-07-17 | cs.LG | ai-safety, cslg, interpretability, preprint | E11 / R9 (90%) | - |
| Interior interpretability with attention rollout: contraction and propagation profiles in Transformers Enrique Zuazua, Qian Huang, Umberto Biccari Published: 2026-07-24Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-07-24 | cs.LG | ai-safety, cslg, interpretability, preprint | - | - |
| KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability Aditi Anand, Ananya Lakshmi Ravi, Balaraman Ravindran, Gokul S. Krishnan Published: 2026-07-27Area: cs.CVCitations: - Tags: ai-safety, cscv, interpretability, preprint | 2026-07-27 | cs.CV | ai-safety, cscv, interpretability, preprint | - | - |
| ECG-InterpBench: Benchmarking the Interpretability of ECG Foundation Models with Matched-Scale Sparse Autoencoders Wei Qiu, Yixuan Duan Published: 2026-07-29Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-07-29 | cs.LG | ai-safety, cslg, interpretability, preprint | E13 / R12 (91%) | - |
| Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers Jacek Tabor, Kamil Ksi膮偶ek, Micha艂 Jan W艂odarczyk, Piotr Suszy艅ski Published: 2026-07-31Area: cs.CVCitations: 41 Tags: ai-safety, cscv, interpretability, preprint | 2026-07-31 | cs.CV | ai-safety, cscv, interpretability, preprint | E10 / R8 (92%) | 41 |
| MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering Jakub Po膰wiardowski, Mateusz Modrzejewski Published: 2026-08-06Area: cs.SDCitations: - Tags: ai-safety, cssd, interpretability, preprint | 2026-08-06 | cs.SD | ai-safety, cssd, interpretability, preprint | E11 / R13 (91%) | - |
| From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das Published: 2026-08-11Area: cs.CLCitations: - Tags: ai-safety, cscl, interpretability, preprint | 2026-08-11 | cs.CL | ai-safety, cscl, interpretability, preprint | E12 / R9 (91%) | - |
| HyperANFIS: Enhancing Rule Representation and Interpretability in Adaptive Neuro-Fuzzy Systems via Hyperbolic Geometry Binbin Yong, Haoran Li, Haoran Pei, Jun Shen Published: 2026-08-12Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-08-12 | cs.AI | ai-safety, csai, interpretability, preprint | - | - |
| Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation Ajay Pravin Mahale Published: 2026-08-13Area: cs.AICitations: - Tags: ai-safety, csai, interpretability, preprint | 2026-08-13 | cs.AI | ai-safety, csai, interpretability, preprint | E10 / R7 (93%) | - |
| Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B David Bau, Jiahao Liu, Octavia Camps, Pu Zhao Published: 2026-08-19Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-08-19 | cs.LG | ai-safety, cslg, interpretability, preprint | E8 / R6 (93%) | - |
| Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability Vijay Erramilli Published: 2026-08-19Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-08-19 | cs.LG | ai-safety, cslg, interpretability, preprint | E9 / R7 (94%) | - |
| Beyond Static Interpretability: Anticipating Post-SFT Mechanisms from Pre-SFT Parameters for Better Tuning Hang Chen, Jiaying Zhu, Wenya Wang Published: 2026-08-25Area: cs.LGCitations: - Tags: ai-safety, cslg, interpretability, preprint | 2026-08-25 | cs.LG | ai-safety, cslg, interpretability, preprint | - | - |
| Causal Scrubbing: A Method for Rigorously Testing Interpretability Hypotheses Adri脙 Garriga-Alonso, Ansh Radhakrishnan, Buck Shlegeris, Jenny Nitishinskaya Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |
| Core Views on AI Safety: When, Why, What, and How Anthropic Published: -Area: Surveys & ReviewsCitations: - Tags: ai-safety, interpretability, position, surveys-reviews | - | Surveys & Reviews | ai-safety, interpretability, position, surveys-reviews | E6 / R4 (95%) | - |
| Cracking the Circuits: Mechanistic Interpretability in Large Language Models Dost Muhammad, Malika Bendechache, Muhammad Salman, Mushtaq Ali Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | - |
| Explaining AI through mechanistic interpretability Barnaby Crook, Lena K盲stner Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (93%) | - |
| From Mechanistic Interpretability to Mechanistic Biology: Training, Evaluating, and Interpreting Sparse Autoencoders on Protein Language Models Etowah Adams, Liam Bai, Minji Lee, Mohammed AlQuraishi Published: -Area: Mechanistic Interp.Citations: 32 Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 32 |
| Gemma Scope 2: Comprehensive Suite of SAEs and Transcoders for Gemma 3 Arthur Conmy, Callum McDougall, Janos Kramar, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (98%) | - |
| Goodfire Ember: Scaling Interpretability for Frontier Model Alignment Atticus Geiger, Curt Tigges, Dan Braun, Daniel Balsam Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, alignment-training, interpretability, mechanistic-interp, tool | E4 / R3 (99%) | - |
| Language Models Can Explain Neurons in Language Models Dan Mossing, Gabriel Goh, Henk Tillman, Ilya Sutskever Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R2 (96%) | - |
| Neuronpedia: Interactive SAE Feature Explorer Johnny Lin Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E6 / R3 (95%) | - |
| SFAL: Semantic-Functional Alignment Scores for Distributional Evaluation of Auto-Interpretability in Sparse Autoencoders Andrea Seveso, Antonio Serino, Daniele Potert矛, Fabio Mercorio Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp, safety-evaluation | - | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | - |
| Sparse Autoencoders Find Partially Interpretable Features in Italian Small Language Models Alessandro Bondielli, Alessandro Lenci, Lucia C. Passaro Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Survey on the Role of Mechanistic Interpretability in Generative AI Leonardo Ranaldi Published: -Area: Surveys & ReviewsCitations: 4 Tags: adversarial-robustness, ai-safety, interpretability, survey, surveys-reviews | - | Surveys & Reviews | adversarial-robustness, ai-safety, interpretability, survey, surveys-reviews | E5 / R4 (94%) | 4 |
| TransformerLens Joseph Bloom, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | - |
| Understanding RL Vision Chris Olah, Gabriel Goh, Jacob Hilton, Nick Cammarata Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | - | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | - |