Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 181-199 of 199 papers (page 7 of 7)路 66 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Subliminal Effects in Your Data: A General Mechanism via Log-Linearity Abhishek Shetty, Allen Liu, Ankur Moitra, Ishaq Aden-Ali Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, theoretical | E4 / R3 (94%) | - |
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective Cheol Woo Kim, Davin Choo, Milind Tambe, Tzeh Yuan Neoh Published: 2026-02-06Area: Formal/TheoreticalCitations: - Tags: adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | 2026-02-06 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | E5 / R3 (93%) | - |
| Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities Majid Ghasemi, Mark Crowley Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (96%) | - |
| Towards Poisoning Robustness Certification for Natural Language Generation Matthew Wicker, Mihnea Ghitu Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | - |
| Trustworthy Agentic AI Requires Deterministic Architectural Boundaries Manish Bhattarai, Minh Vu Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | - |
| Why Linear Interpretability Works: Invariant Subspaces as a Result of Architectural Constraints Andres Saurez, Dongsoo Har, Yousung Lee Published: 2026-02-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2026-02-10 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (96%) | - |
| Authenticated Workflows: A Systems Approach to Protecting Agentic AI Mohan Rajagopalan, Vinay Rao Published: 2026-02-11Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, theoretical | 2026-02-11 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R4 (96%) | - |
| How Many Features Can a Language Model Store Under the Linear Representation Hypothesis? Jon Kleinberg, Kenny Peng, Nikhil Garg Published: 2026-02-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | 2026-02-11 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E4 / R2 (93%) | - |
| Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI Mohan Rajagopalan, Vinay Rao Published: 2026-02-11Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2026-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (99%) | 1 |
| Unifying Stable Optimization and Reference Regularization in RLHF Dadong Wang, He Zhao, Li He, Lina Yao Published: 2026-02-12Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2026-02-12 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment Elias Malomgr茅, Pieter Simoens Published: 2026-02-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (97%) | - |
| A Mathematical Framework for Transformer Circuits Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | - | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (95%) | - |
| A Toy Model of Mechanistic (Un)Faithfulness Chris Olah Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, theoretical | - | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (93%) | - |
| A Two-Step, Multidimensional Account of Deception in Language Models Leonard Dung Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | - | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (95%) | - |
| Aversion to external feedback suffices to ensure agent alignment Paulo Garcia Published: -Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | - | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (93%) | 1 |
| Eliciting Latent Knowledge (ELK) Ajeya Cotra, Mark Xu, Paul Christiano Published: -Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | - | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E6 / R2 (96%) | - |
| Explaining AI through mechanistic interpretability Barnaby Crook, Lena K盲stner Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, theoretical | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (93%) | - |
| Toward Constitutional Autonomy in AI Systems: A Theoretical Framework for Aligned Agentic Intelligence William Torgbi Agbemabiese Published: -Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | - | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E4 / R3 (93%) | 1 |