Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Geometric Unification of Concept Learning with Concept Cones Alexandre Rocchi-Henry, Gianni Franchi, Thomas Fel Published: 2025-12-08Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, mechanistic-interp, theoretical | 2025-12-08 | Mechanistic Interp. | ai-safety, alignment-training, mechanistic-interp, theoretical | E5 / R4 (94%) | - |
| A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima Dianbo Liu, Harshvardhan Saini, Yiming Tang, Yizhen Liao Published: 2025-12-05Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-12-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (95%) | - |
| Invasive Context Engineering to Control Large Language Models Thomas Rivasseau Published: 2025-12-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-12-02 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | - |
| Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM Adarsh Kumarappan, Ayushi Mehrotra Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| LLM Reinforcement in Context Thomas Rivasseau Published: 2025-11-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-11-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | - |
| Control Barrier Function for Aligning Large Language Models Masaki Inoue, Yuya Miyaoka Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (96%) | 2 |
| LLM Probing with Contrastive Eigenproblems: Improving Understanding and Applicability of CCS Peter Bloem, Stefan F. Schouten Published: 2025-11-03Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-11-03 | Representation Analysis | ai-safety, representation-analysis, theoretical | E4 / R2 (93%) | - |
| The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy Mohsen Bayati, William Overman Published: 2025-10-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-10-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| Debiasing Reward Models by Representation Learning with Guarantees Ignavier Ng, Kun Zhang, Patrick Bl枚baum, Shiva Kasiviswanathan Published: 2025-10-27Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-10-27 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| Scalable Oversight via Partitioned Human Supervision Masashi Sugiyama, Ren Yin, Takashi Ishida Published: 2025-10-26Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-26 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (96%) | - |
| A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring Julian Schulz Published: 2025-10-22Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-22 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E7 / R3 (94%) | - |
| Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs Masahiro Kaneko, Timothy Baldwin Published: 2025-10-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| On the Impossibility of Retrain Equivalence in Machine Unlearning Anirudh Goyal, Jiatong Yu, Sanjeev Arora, Yinghui He Published: 2025-10-18Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, theoretical | 2025-10-18 | Model Editing | ai-safety, model-editing, theoretical | E6 / R3 (95%) | 2 |
| Corrigibility Transformation: Constructing Goals That Accept Updates Rubi Hudson Published: 2025-10-17Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, theoretical | 2025-10-17 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (94%) | - |
| From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails Andrea Bajcsy, Changliu Liu, Duy P. Nguyen, Jaime Fern谩ndez Fisac Published: 2025-10-15Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, theoretical | 2025-10-15 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (94%) | 1 |
| AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures? Florian Mai, Leonard Dung Published: 2025-10-13Area: Formal/TheoreticalCitations: - Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-10-13 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E8 / R2 (97%) | - |
| Provably Convergent Primal-Dual DPO for Constrained LLM Alignment R. Srikant, Seo Taek Kong, Yihan Du Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (95%) | - |
| Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment Heng Huang, Junyi Li, Peiran Yu, Ziyi Chen Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E7 / R4 (96%) | - |
| Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization Antoine Maier, Aude Maier, Tom David Published: 2025-10-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2025-10-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF Jing Liu Published: 2025-09-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, interpretability, theoretical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, interpretability, theoretical | E5 / R3 (94%) | - |
| LLM Interpretability with Identifiable Temporal-Instantaneous Representation Jiaqi Sun, Kun Zhang, Xiangchen Song, Yujia Zheng Published: 2025-09-27Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-09-27 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E4 / R3 (94%) | 2 |
| Toward a Theory of Generalizability in LLM Mechanistic Interpretability Research Sean Trott Published: 2025-09-26Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-09-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E4 / R3 (94%) | 2 |
| A Unified Framework for Diffusion Model Unlearning with f-Divergence Andrea M. Tonello, Deniz G眉nd眉z, Federico Fontana, Luigi Cinque Published: 2025-09-25Area: Model EditingCitations: - Tags: ai-safety, model-editing, theoretical | 2025-09-25 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (96%) | - |
| Towards Atoms of Large Language Models Chenhui Hu, Jun Zhao, Kang Liu, Pengfei Cao Published: 2025-09-25Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2025-09-25 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (98%) | - |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| Understanding sparse autoencoder scaling in the presence of feature manifolds Eric J. Michaud, Liv Gorton, Tom McGrath Published: 2025-09-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, mechanistic-interp, theoretical | 2025-09-02 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E4 / R3 (93%) | 2 |
| On Surjectivity of Neural Networks: Can you elicit any behavior from your model? Haozhe Jiang, Nika Haghtalab Published: 2025-08-26Area: Formal/TheoreticalCitations: 3 Tags: adversarial-robustness, ai-safety, formaltheoretical, theoretical | 2025-08-26 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, theoretical | E6 / R3 (95%) | 3 |
| AI Testing Should Account for Sophisticated Strategic Behaviour Alexis Ghersengorin, Eric Olav Chen, Sami Petersen, Vincent Conitzer Published: 2025-08-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-08-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E6 / R3 (96%) | 3 |
| Incident Analysis for AI Agents Alan Chan, Carson Ezell, Xavier Roberts-Gaal Published: 2025-08-19Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, theoretical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (91%) | 2 |
| Provably Secure Retrieval-Augmented Generation Pengcheng Zhou, Yinglun Feng, Zhongliang Yang Published: 2025-08-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R4 (96%) | - |