Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| Preference Learning for AI Alignment: a Causal Perspective Katarzyna Kobalczyk, Mihaela van der Schaar Published: 2025-06-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-06 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 2 |
| Structure before the Machine: Input Space is the Prerequisite for Concepts Ang Li, Bowei Tian, Hongyi Wang, Meng Liu Published: 2025-06-10Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-06-10 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (94%) | - |
| Avoiding Obfuscation with Prover-Estimator Debate Geoffrey Irving, Georgios Piliouras, Jonah Brown-Cohen Published: 2025-06-16Area: Scalable OversightCitations: 6 Tags: ai-safety, scalable-oversight, theoretical | 2025-06-16 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (94%) | 6 |
| Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs Gilad Freidkin, Hen Davidov, Shai Feldman, Yaniv Romano Published: 2025-06-16Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, theoretical | 2025-06-16 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (95%) | - |
| Resource Rational Contractualism Should Guide AI Alignment Daniel Kilov, Iason Gabriel, Joshua B. Tenenbaum, Lionel Wong Published: 2025-06-20Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-20 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 2 |
| On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment Frauke Kreuter, Greg Gluch, Guy N. Rothblum, Omer Reingold Published: 2025-07-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (97%) | 4 |
| Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers Santhosh Kumar Ravindran Published: 2025-07-12Area: Deception & FailureCitations: 1 Tags: adversarial-robustness, ai-safety, deception-failure, theoretical | 2025-07-12 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, theoretical | E5 / R3 (92%) | 1 |
| Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Edward James Young, James Walpole, Jason R. Brown, Lindley Lentati Published: 2025-07-17Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, theoretical | 2025-07-17 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (93%) | 1 |
| Combining Cost-Constrained Runtime Monitors for AI Safety Aryan Bhatt, Henri Lemoine, James Baskerville, Mia Hopman Published: 2025-07-19Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 9 |
| Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems Andrii Balashov, Olena Ponomarova, Xiaohua Zhai Published: 2025-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | - |
| The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models Xingcheng Xu Published: 2025-07-27Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-27 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R4 (96%) | 4 |
| Provably Secure Retrieval-Augmented Generation Pengcheng Zhou, Yinglun Feng, Zhongliang Yang Published: 2025-08-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R4 (96%) | - |
| AI Testing Should Account for Sophisticated Strategic Behaviour Alexis Ghersengorin, Eric Olav Chen, Sami Petersen, Vincent Conitzer Published: 2025-08-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-08-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E6 / R3 (96%) | 3 |
| Incident Analysis for AI Agents Alan Chan, Carson Ezell, Xavier Roberts-Gaal Published: 2025-08-19Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, theoretical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (91%) | 2 |
| On Surjectivity of Neural Networks: Can you elicit any behavior from your model? Haozhe Jiang, Nika Haghtalab Published: 2025-08-26Area: Formal/TheoreticalCitations: 3 Tags: adversarial-robustness, ai-safety, formaltheoretical, theoretical | 2025-08-26 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, theoretical | E6 / R3 (95%) | 3 |
| Understanding sparse autoencoder scaling in the presence of feature manifolds Eric J. Michaud, Liv Gorton, Tom McGrath Published: 2025-09-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, mechanistic-interp, theoretical | 2025-09-02 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E4 / R3 (93%) | 2 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| A Unified Framework for Diffusion Model Unlearning with f-Divergence Andrea M. Tonello, Deniz G眉nd眉z, Federico Fontana, Luigi Cinque Published: 2025-09-25Area: Model EditingCitations: - Tags: ai-safety, model-editing, theoretical | 2025-09-25 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (96%) | - |
| Towards Atoms of Large Language Models Chenhui Hu, Jun Zhao, Kang Liu, Pengfei Cao Published: 2025-09-25Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2025-09-25 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (98%) | - |
| Toward a Theory of Generalizability in LLM Mechanistic Interpretability Research Sean Trott Published: 2025-09-26Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-09-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E4 / R3 (94%) | 2 |
| LLM Interpretability with Identifiable Temporal-Instantaneous Representation Jiaqi Sun, Kun Zhang, Xiangchen Song, Yujia Zheng Published: 2025-09-27Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-09-27 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E4 / R3 (94%) | 2 |
| Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF Jing Liu Published: 2025-09-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, interpretability, theoretical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, interpretability, theoretical | E5 / R3 (94%) | - |
| Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization Antoine Maier, Aude Maier, Tom David Published: 2025-10-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2025-10-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Provably Convergent Primal-Dual DPO for Constrained LLM Alignment R. Srikant, Seo Taek Kong, Yihan Du Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (95%) | - |
| Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment Heng Huang, Junyi Li, Peiran Yu, Ziyi Chen Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E7 / R4 (96%) | - |
| AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures? Florian Mai, Leonard Dung Published: 2025-10-13Area: Formal/TheoreticalCitations: - Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-10-13 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E8 / R2 (97%) | - |
| From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails Andrea Bajcsy, Changliu Liu, Duy P. Nguyen, Jaime Fern谩ndez Fisac Published: 2025-10-15Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, theoretical | 2025-10-15 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (94%) | 1 |
| Corrigibility Transformation: Constructing Goals That Accept Updates Rubi Hudson Published: 2025-10-17Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, theoretical | 2025-10-17 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (94%) | - |
| On the Impossibility of Retrain Equivalence in Machine Unlearning Anirudh Goyal, Jiatong Yu, Sanjeev Arora, Yinghui He Published: 2025-10-18Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, theoretical | 2025-10-18 | Model Editing | ai-safety, model-editing, theoretical | E6 / R3 (95%) | 2 |