Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs Masahiro Kaneko, Timothy Baldwin Published: 2025-10-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring Julian Schulz Published: 2025-10-22Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-22 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E7 / R3 (94%) | - |
| Scalable Oversight via Partitioned Human Supervision Masashi Sugiyama, Ren Yin, Takashi Ishida Published: 2025-10-26Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-26 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (96%) | - |
| Debiasing Reward Models by Representation Learning with Guarantees Ignavier Ng, Kun Zhang, Patrick Bl枚baum, Shiva Kasiviswanathan Published: 2025-10-27Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-10-27 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy Mohsen Bayati, William Overman Published: 2025-10-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-10-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| LLM Probing with Contrastive Eigenproblems: Improving Understanding and Applicability of CCS Peter Bloem, Stefan F. Schouten Published: 2025-11-03Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-11-03 | Representation Analysis | ai-safety, representation-analysis, theoretical | E4 / R2 (93%) | - |
| Control Barrier Function for Aligning Large Language Models Masaki Inoue, Yuya Miyaoka Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (96%) | 2 |
| LLM Reinforcement in Context Thomas Rivasseau Published: 2025-11-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-11-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | - |
| Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM Adarsh Kumarappan, Ayushi Mehrotra Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| Invasive Context Engineering to Control Large Language Models Thomas Rivasseau Published: 2025-12-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-12-02 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | - |
| A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima Dianbo Liu, Harshvardhan Saini, Yiming Tang, Yizhen Liao Published: 2025-12-05Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-12-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (95%) | - |
| A Geometric Unification of Concept Learning with Concept Cones Alexandre Rocchi-Henry, Gianni Franchi, Thomas Fel Published: 2025-12-08Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, mechanistic-interp, theoretical | 2025-12-08 | Mechanistic Interp. | ai-safety, alignment-training, mechanistic-interp, theoretical | E5 / R4 (94%) | - |
| Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality Eric P. Xing, Guangyi Chen, Kun Zhang, Lingjing Kong Published: 2025-12-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2025-12-11 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (94%) | - |
| Practical challenges of control monitoring in frontier AI deployments Alan Cooney, Charlie Griffin, David Lindner, Geoffrey Irving Published: 2025-12-15Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, theoretical | 2025-12-15 | Agent Safety | agent-safety, ai-safety, theoretical | E6 / R4 (93%) | 1 |
| Provably Extracting the Features from a General Superposition Allen Liu Published: 2025-12-17Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, interpretability, theoretical | 2025-12-17 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, theoretical | E4 / R2 (96%) | - |
| Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability Ge Yan, Tsui-Wei (Lily) Weng, Tuomas Oikarinen Published: 2025-12-19Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2025-12-19 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| Towards Provably Secure Generative AI: Reliable Consensus Sampling Baohan Huang, Bo Ran, Cong Zuo, Haibin Zhang Published: 2025-12-31Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, theoretical | 2025-12-31 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E4 / R3 (94%) | - |
| Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling Weiqiang Zheng, Yang Cai Published: 2026-01-13Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-13 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment Felix Jahn, Kevin Baum, Lisa Dargasz, Patrick Schramowski Published: 2026-01-15Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-01-15 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R4 (96%) | - |
| Patterning: The Dual of Interpretability Daniel Murfet, George Wang Published: 2026-01-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2026-01-20 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E6 / R4 (95%) | - |
| Feature-Space Adversarial Robustness Certification for Multimodal Large Language Models Chenqi Kong, Meiwen Ding, Song Xia, Wenhan Yang Published: 2026-01-22Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2026-01-22 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E4 / R3 (95%) | - |
| Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming Abhinav Palia, A. Feder Cooper, Alexandra Chouldechova, Dan Vann Published: 2026-01-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, red-teaming, safety-evaluation, theoretical | 2026-01-26 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, theoretical | E5 / R3 (95%) | 1 |
| Dynamics Reveals Structure: Challenging the Linear Propagation Assumption B谩lint Mucs谩nyi, Hoyeon Chang, Seong Joon Oh Published: 2026-01-29Area: Formal/TheoreticalCitations: - Tags: ai-safety, formaltheoretical, theoretical | 2026-01-29 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (92%) | - |
| Jailbreaking LLMs via Calibration Yongkang Guo, Yuqing Kong, Yuxuan Lu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | - |
| Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective Ce Li, Haichuan Wang, Hezi Jiang, Lingkai Kong Published: 2026-01-31Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-31 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | - |
| How RLHF Amplifies Sycophancy Ariel D. Procaccia, Gerdus Benade, Itai Shapira Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO Akifumi Wachi, Kohei Miyaguchi, Rei Higuchi, Shokichi Takakura Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Spectral Superposition: A Theory of Feature Geometry Amir Abdullah, Georgi Ivanov, Narmeen Oozeer, Shivam Raval Published: 2026-02-02Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2026-02-02 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (94%) | - |
| Towards Understanding Steering Strength Damien Garreau, Magamed Taimeskhanov, Samuel Vaiter Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2026-02-02 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (96%) | - |
| Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics Chenyan Wu, Haiwen Hong, Hengyu Sun, Huajun Chen Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, model-editing, theoretical | 2026-02-02 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (95%) | - |