Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 211 papers (page 1 of 8)路 45 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Capability-Oriented Training Induced Alignment Risk Han Bao, Kehan Guo, Nitesh V Chawla, Nuno Moniz Published: 2026-02-12Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-12 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (94%) | 1 |
| In-the-Wild Model Organisms: Mitigating Undesirable Emergent Behaviors in Production LLM Post-Training via Data Attribution Frank Xiao, Santiago Aranguri Published: 2026-02-11Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-11 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| Emergent Misalignment is Easy, Narrow Misalignment is Hard Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities Majid Ghasemi, Mark Crowley Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (96%) | - |
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities Dietrich Klakow, Felix Michalak, Florian Dietz, Gustavo Ewbank Rodrigues Danon Published: 2026-02-05Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | - |
| CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation Chunlin Gong, Haichao Shi, Qiang Liu, Shu Wu Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R2 (96%) | - |
| Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models Binghai Wang, Bowen Yu, Chang Gao, Chujie Zheng Published: 2026-02-04Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 1 |
| Subliminal Effects in Your Data: A General Mechanism via Log-Linearity Abhishek Shetty, Allen Liu, Ankur Moitra, Ishaq Aden-Ali Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, theoretical | E4 / R3 (94%) | - |
| The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment Fandong Meng, Hao Zhou, Hongning Wang, Jie Zhou Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R2 (94%) | - |
| Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models Aarush Rathore, Aditya Nagarsekar, Anish Sathyanarayanan Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (93%) | - |
| The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers Amanda Minnich, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking Junshan Zhang, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2026-02-02Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2026-02-02 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |
| How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments Amr Alazali, Fuxin Wang, Yiqiao Zhong Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | - |
| How RLHF Amplifies Sycophancy Ariel D. Procaccia, Gerdus Benade, Itai Shapira Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning Abhishek Mishra, Deepesh Suranjandass, Donnie Winkelmann, Mugilan Arulvanan Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures Jie Zhang, Nenghai Yu, Qiu Han, Tianwei Zhang Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models Charles Westphal, Fernando E. Rosas, Keivan Navaie Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| RAudit: A Blind Auditing Protocol for Large Language Model Reasoning Edward Y. Chang, Longling Geng Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity? Alexander H盲gele, Aryo Pradipta Gema, Ethan Perez, Henry Sleight Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models Jacek Duszenko Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-29 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis Anand Kannappan, Darshan Deshpande, Rebecca Qian Published: 2026-01-27Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure, safety-evaluation | 2026-01-27 | Deception & Failure | ai-safety, benchmark, deception-failure, safety-evaluation | E5 / R3 (94%) | - |
| Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models Anmol Goel, Cornelius Emde, Martin Gubri, Sangdoo Yun Published: 2026-01-21Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-21 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy Sarthak Sattigeri Published: 2026-01-19Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | - |
| Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity Chi Zhang, Hongjun An, Jiangan Chen, Jiawei Shao Published: 2026-01-10Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-10 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Understanding Reward Hacking in Text-to-Image Reinforcement Learning Cho-Jui Hsieh, Hengguang Zhou, Kuei-Chun Kao, Yunqi Hong Published: 2026-01-06Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2026-01-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 1 |
| Steerability of Instrumental-Convergence Tendencies in LLMs Jakub Hoscilowicz Published: 2026-01-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Can We Trust AI Explanations? Evidence of Systematic Underreporting in Chain-of-Thought Reasoning Deep Pankajbhai Mehta Published: 2025-12-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-25 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |