Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content Arkaitz Zubiaga, Shaz Furniturewala Published: 2025-09-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-09-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E6 / R3 (96%) | - |
| Can LLMs Lie? Investigation beyond Hallucination Deepak Pathak, Haoran Huan, Mengning Wu, Mihir Prabhudesai Published: 2025-09-03Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-09-03 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (94%) | 1 |
| CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders Alex Gulko, Sachin Kumar, Yusen Peng Published: 2025-08-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-08-31 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| Mechanistic Interpretability for Steering Vision-Language-Action Models Bear H盲on, Claire Tomlin, Ian Chuang, Kaylene Stocking Published: 2025-08-30Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-30 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | 3 |
| AdaptiveK Sparse Autoencoders: Dynamic Sparsity Allocation for Interpretable LLM Representations Mengnan Du, Yifei Yao Published: 2025-08-24Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-24 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (94%) | 1 |
| Evaluating Sparse Autoencoders for Monosemantic Representation A.B. Siddique, Moghis Fereidouni, Muhammad Umair Haider, Peizhong Ju Published: 2025-08-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-20 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |
| A Review of Developmental Interpretability in Large Language Models Ihor Kendiukhov Published: 2025-08-19Area: Surveys & ReviewsCitations: - Tags: ai-safety, interpretability, survey, surveys-reviews | 2025-08-19 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E6 / R4 (94%) | - |
| Mechanistic Exploration of Backdoored Large Language Model Attention Patterns Lakshmi Babu-Saheer, Mohammed Abu Baker Published: 2025-08-19Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-19 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | - |
| Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes Jinku Li, Rui Jiao, Yue Zhang Published: 2025-07-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, interpretability | 2025-07-25 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (96%) | - |
| Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning Adam Karvonen, Caden Juang, Helena Casademunt, Neel Nanda Published: 2025-07-22Area: Model EditingCitations: 13 Tags: ai-safety, alignment-training, empirical, interpretability, model-editing | 2025-07-22 | Model Editing | ai-safety, alignment-training, empirical, interpretability, model-editing | E6 / R3 (93%) | 13 |
| Evaluating SAE interpretability without explanations Gon莽alo Paulo, Nora Belrose Published: 2025-07-11Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 1 |
| The Non-Linear Representation Dilemma: Is Causal Abstraction Enough for Mechanistic Interpretability? Denis Sutter, Julian Minder, Thomas Hofmann, Tiago Pimentel Published: 2025-07-11Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 11 |
| Can Interpretation Predict Behavior on Unseen Data? David Alvarez-Melis, Jenny Kaufmann, Martin Wattenberg, Naomi Saphra Published: 2025-07-08Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-08 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (92%) | 5 |
| TRACE: Training and Inference-Time Interpretability Analysis for Language Models Andr茅 Freitas, Danilo S. Carvalho, Nura Aljaafari Published: 2025-07-04Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-07-04 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability Galvin Khara, Joachim Schaeffer, Luca Baroni, Marat Subkhankulov Published: 2025-07-03Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 4 |
| Mechanistic Interpretability Needs Philosophy Anders S酶gaard, Constanza Fierro, Filippos Stamatiou, Iwan Williams Published: 2025-06-23Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 3 |
| Because we have LLMs, we Can and Should Pursue Agentic Interpretability Been Kim, John Hewitt, Neel Nanda, Noah Fiedel Published: 2025-06-13Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, interpretability, mechanistic-interp, position | 2025-06-13 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 9 |
| InverseScope: Scalable Activation Inversion for Interpreting Large Language Models Bin Dong, Yifan Luo, Zhennan Zhou Published: 2025-06-09Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-06-09 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model Ilcahe Jung, Kangsan Kim, Kwanyong Park, Seanie Lee Published: 2025-06-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, benchmark, interpretability, multimodal-safety | 2025-06-05 | Multimodal Safety | ai-safety, benchmark, interpretability, multimodal-safety | E4 / R3 (98%) | 4 |
| Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders Daniil Gavrilov, Daniil Laptev, Nikita Balagansky, Vadim Kurochkin Published: 2025-05-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| Towards Interpretability Without Sacrifice: Faithful Dense Layer Decomposition with Mixture of Decoders Grigorios G Chrysos, Ioannis Patras, James Oldfield, Mihalis A. Nicolaou Published: 2025-05-27Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 1 |
| Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs Aashiq Muhamed, Kun Zhang, Lingjing Kong, Mona T. Diab Published: 2025-05-26Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | 2025-05-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | E5 / R3 (95%) | 6 |
| GIM: Improved Interpretability for Large Language Models Jing Huang, Joakim Edin, Lars Maal酶e, Maria Maistro Published: 2025-05-23Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-23 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E7 / R3 (96%) | 1 |
| Interpretability Illusions with Sparse Autoencoders Aaron J. Li, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2025-05-21Area: Mechanistic Interp.Citations: 5 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 5 |
| Towards eliciting latent knowledge from LLMs with mechanistic interpretability Bartosz Cywi艅ski, Emil Ryd, Neel Nanda, Senthooran Rajamanoharan Published: 2025-05-20Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-20 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | 6 |
| Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors Christopher Potts, Diyi Yang, Jing Huang, Junyi Tao Published: 2025-05-17Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E8 / R3 (99%) | 4 |
| Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii Kola Ayonrinde, Louis Jaburi Published: 2025-05-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-02 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | 2 |
| A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i Kola Ayonrinde, Louis Jaburi Published: 2025-05-01Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-01 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R3 (95%) | 4 |
| Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition Junping Zhang, Junxuan Wang, Qiong Tang, Rui Lin Published: 2025-04-29Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-04-29 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 2 |