Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes Jinku Li, Rui Jiao, Yue Zhang Published: 2025-07-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, interpretability | 2025-07-25 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (96%) | - |
| Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement V铆ctor Gallego Published: 2025-07-24Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-07-24 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | 2 |
| Subliminal Learning: Language models transmit behavioral traits via hidden signals in data Alex Cloud, Anna Sztyber-Betley, Jacob Hilton, James Chua Published: 2025-07-20Area: Deception & FailureCitations: 35 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R4 (96%) | 35 |
| Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Edward James Young, James Walpole, Jason R. Brown, Lindley Lentati Published: 2025-07-17Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, theoretical | 2025-07-17 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (93%) | 1 |
| Benchmarking Deception Probes via Black-to-White Performance Boosts Aviel Parrack, Carlo Leonardo Attubato, Stefan Heimersheim Published: 2025-07-16Area: Deception & FailureCitations: 8 Tags: ai-safety, benchmark, deception-failure | 2025-07-16 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (93%) | 8 |
| Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers Santhosh Kumar Ravindran Published: 2025-07-12Area: Deception & FailureCitations: 1 Tags: adversarial-robustness, ai-safety, deception-failure, theoretical | 2025-07-12 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, theoretical | E5 / R3 (92%) | 1 |
| One Token to Fool LLM-as-a-Judge Dian Yu, Dong Yu, Haitao Mi, Haolin Liu Published: 2025-07-11Area: Deception & FailureCitations: 34 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-07-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (98%) | 34 |
| Probing and Steering Evaluation Awareness of Language Models Carlo Leonardo Attubato, Felix Hofst盲tter, Jord Nguyen, Khiem Hoang Published: 2025-07-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-02 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (93%) | 8 |
| LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance Igor Ivanov Published: 2025-06-30Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (97%) | 1 |
| Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning Andy Arditi, Joe Benton, Julian Michael, Marvin Li Published: 2025-06-28Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical | 2025-06-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | 8 |
| Inference-Time Reward Hacking in Large Language Models Alex Oesterling, Claudio Mayrink Verdun, Flavio du Pin Calmon, Hadi Khalaf Published: 2025-06-24Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | 4 |
| Persona Features Control Emergent Misalignment Achyuta Rajaram, Alex Makelov, Dan Mossing, Jeffrey Wang Published: 2025-06-24Area: Deception & FailureCitations: 27 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R4 (96%) | 27 |
| Why Do Some Language Models Fake Alignment While Others Don't? Abhay Sheshadri, Alex Mallen, Arun Jose, Fabien Roger Published: 2025-06-22Area: Deception & FailureCitations: 6 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (96%) | 6 |
| Empirical Evidence for Alignment Faking in Small LLMs and Prompt-Based Mitigation Techniques J. Koorndijk Published: 2025-06-17Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors? Erik Jenner, Rohan Gupta Published: 2025-06-17Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 5 |
| Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models James Chua, Jan Betley, Mia Taylor, Owain Evans Published: 2025-06-16Area: Deception & FailureCitations: 33 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 33 |
| Model Organisms for Emergent Misalignment Anna Soligo, Edward Turner, Mia Taylor, Neel Nanda Published: 2025-06-13Area: Deception & FailureCitations: 30 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R5 (95%) | 30 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models Kai Wang, Meng Sun, Yihao Zhang Published: 2025-06-05Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-06-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| Large language models can learn and generalize steganographic chain-of-thought under process supervision Cameron Tice, Connor Watts, David Lindner, Edward James Young Published: 2025-06-02Area: Deception & FailureCitations: 16 Tags: ai-safety, deception-failure, empirical | 2025-06-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 16 |
| A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models Samyadeep Basu, Soheil Feizi, Sriram Balasubramanian Published: 2025-05-29Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2025-05-29 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | 4 |
| Large Language Models Often Know When They Are Being Evaluated Giles Edkins, Govind Pimpale, Henning Bartsch, Joe Needham Published: 2025-05-28Area: Deception & FailureCitations: 31 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-28 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 31 |
| Mitigating Deceptive Alignment via Self-Monitoring Boyuan Chen, Donghai Hong, Jiaming Ji, Jiayi Zhou Published: 2025-05-24Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-05-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 14 |
| But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors Alan McBeth, Archie Chaudhury, Ethan Nguyen, Leon Eshuijs Published: 2025-05-23Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-05-23 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems Min Yang, Wenqi Zhang, Xudong Pan, Yihe Fan Published: 2025-05-23Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-23 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 6 |
| Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning Mark Vero, Martin Vechev, Robin Staab, Thibaud Gloaguen Published: 2025-05-22Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-05-22 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E6 / R4 (96%) | - |
| ELEPHANT: Measuring and understanding social sycophancy in LLMs Cinoo Lee, Dan Jurafsky, Lujain Ibrahim, Myra Cheng Published: 2025-05-20Area: Deception & FailureCitations: 19 Tags: ai-safety, benchmark, deception-failure | 2025-05-20 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (97%) | 19 |
| Preference Learning with Lie Detectors can Induce Honesty or Evasion Adam Gleave, Chris Cundy Published: 2025-05-20Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2025-05-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 7 |
| The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness Ahmed Salem, Sahar Abdelnabi Published: 2025-05-20Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 7 |
| Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models Himabindu Lakkaraju, Shan Chen, Zhenting Qi, Zidi Xiong Published: 2025-05-19Area: Deception & FailureCitations: 10 Tags: ai-safety, deception-failure, empirical | 2025-05-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 10 |