Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models Xingcheng Xu Published: 2025-07-27Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-27 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R4 (96%) | 4 |
| Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems Andrii Balashov, Olena Ponomarova, Xiaohua Zhai Published: 2025-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | - |
| Combining Cost-Constrained Runtime Monitors for AI Safety Aryan Bhatt, Henri Lemoine, James Baskerville, Mia Hopman Published: 2025-07-19Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 9 |
| Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Edward James Young, James Walpole, Jason R. Brown, Lindley Lentati Published: 2025-07-17Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, theoretical | 2025-07-17 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (93%) | 1 |
| Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers Santhosh Kumar Ravindran Published: 2025-07-12Area: Deception & FailureCitations: 1 Tags: adversarial-robustness, ai-safety, deception-failure, theoretical | 2025-07-12 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, theoretical | E5 / R3 (92%) | 1 |
| On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment Frauke Kreuter, Greg Gluch, Guy N. Rothblum, Omer Reingold Published: 2025-07-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (97%) | 4 |
| Resource Rational Contractualism Should Guide AI Alignment Daniel Kilov, Iason Gabriel, Joshua B. Tenenbaum, Lionel Wong Published: 2025-06-20Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-20 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 2 |
| Avoiding Obfuscation with Prover-Estimator Debate Geoffrey Irving, Georgios Piliouras, Jonah Brown-Cohen Published: 2025-06-16Area: Scalable OversightCitations: 6 Tags: ai-safety, scalable-oversight, theoretical | 2025-06-16 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (94%) | 6 |
| Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs Gilad Freidkin, Hen Davidov, Shai Feldman, Yaniv Romano Published: 2025-06-16Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, theoretical | 2025-06-16 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (95%) | - |
| Structure before the Machine: Input Space is the Prerequisite for Concepts Ang Li, Bowei Tian, Hongyi Wang, Meng Liu Published: 2025-06-10Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-06-10 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (94%) | - |
| Preference Learning for AI Alignment: a Causal Perspective Katarzyna Kobalczyk, Mihaela van der Schaar Published: 2025-06-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-06 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 2 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| The Limits of Predicting Agents from Behaviour Alexis Bellot, Jonathan Richens, Tom Everitt Published: 2025-06-03Area: Formal/TheoreticalCitations: 1 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-03 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (93%) | 1 |
| Will artificial agents pursue power by default? Christian Tarsney Published: 2025-06-02Area: Formal/TheoreticalCitations: 1 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-02 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (92%) | 1 |
| Conformal Arbitrage: Risk-Controlled Balancing of Competing Objectives in Language Models Mohsen Bayati, William Overman Published: 2025-06-01Area: Formal/TheoreticalCitations: 3 Tags: ai-safety, formaltheoretical, theoretical | 2025-06-01 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (96%) | 3 |
| From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models Haibo Jin, Haohan Wang, Man Luo, Peiran Wang Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | 3 |
| On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective Gengze Xu, Wei Yao, Yong Liu, Ziqiao Wang Published: 2025-05-30Area: Scalable OversightCitations: 1 Tags: ai-safety, scalable-oversight, theoretical | 2025-05-30 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E4 / R3 (93%) | 1 |
| Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences? Kunhe Yang, Nika Haghtalab, Paul G枚lz Published: 2025-05-29Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 11 |
| Concealment of Intent: A Game-Theoretic Analysis Abhishek Umrawal, Lav R. Varshney, Xinbo Wu Published: 2025-05-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | - |
| An Example Safety Case for Safeguards Against Misuse Jonah Weinbaum, Joshua Clymer, Kimberly Mai, Robert Kirk Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-05-23 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| Scalable Valuation of Human Feedback through Provably Robust Model Alignment Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| The Origins of Representation Manifolds in Large Language Models Alexander Modell, Nick Whiteley, Patrick Rubin-Delanchy Published: 2025-05-23Area: Representation AnalysisCitations: 11 Tags: ai-safety, representation-analysis, theoretical | 2025-05-23 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (93%) | 11 |
| Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners Hiroshi Kera, Soichiro Kumano, Toshihiko Yamasaki Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 1 |
| SplInterp: Improving our Understanding and Training of Sparse Autoencoders Benjamin Macdowall Rynne, Javier Ideami, Jeremy Budd, Keith Duggar Published: 2025-05-17Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2025-05-17 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| Rethinking Circuit Completeness in Language Models: AND, OR, and ADDER Gates Hang Chen, Jiaying Zhu, Wenya Wang, Xinyu Yang Published: 2025-05-15Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, mechanistic-interp, theoretical | 2025-05-15 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E6 / R3 (94%) | 3 |
| Access Controls Will Solve the Dual-Use Dilemma Ev啪en Wybitul Published: 2025-05-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-14 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 2 |
| An Alignment Safety Case Sketch Based on Debate Benjamin Hilton, Geoffrey Irving, Jacob Pfau, Marie Davidsen Buhl Published: 2025-05-06Area: Scalable OversightCitations: 8 Tags: ai-safety, alignment-training, scalable-oversight, theoretical | 2025-05-06 | Scalable Oversight | ai-safety, alignment-training, scalable-oversight, theoretical | E5 / R3 (94%) | 8 |
| Evaluating Explanations: An Explanatory Virtues Framework for Mechanistic Interpretability -- The Strange Science Part I.ii Kola Ayonrinde, Louis Jaburi Published: 2025-05-02Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-02 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | 2 |
| A Mathematical Philosophy of Explanations in Mechanistic Interpretability -- The Strange Science Part I.i Kola Ayonrinde, Louis Jaburi Published: 2025-05-01Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-05-01 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R3 (95%) | 4 |
| Characterizing AI Agents for Alignment and Governance Atoosa Kasirzadeh, Iason Gabriel Published: 2025-04-30Area: Agent SafetyCitations: 28 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-04-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R5 (95%) | 28 |