Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs Jeremiah Giordani Published: 2025-07-04Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| Discourse Heuristics For Paradoxically Moral Self-Correction Guangliang Liu, Kristen Marie Johnson, Xitong Zhang, Zimo Qi Published: 2025-07-01Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| SAFER: Probing Safety in Reward Models with Sparse Autoencoder Guojun Ma, Sihang Li, Tao Liang, Wei Shi Published: 2025-07-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-07-01 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (96%) | 2 |
| Linearly Decoding Refused Knowledge in Aligned Language Models Ari Holtzman, Aryan Shrivastava Published: 2025-06-30Area: Representation AnalysisCitations: 2 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-30 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R4 (92%) | 2 |
| LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance Igor Ivanov Published: 2025-06-30Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (97%) | 1 |
| Inference-Time Reward Hacking in Large Language Models Alex Oesterling, Claudio Mayrink Verdun, Flavio du Pin Calmon, Hadi Khalaf Published: 2025-06-24Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | 4 |
| Persona Features Control Emergent Misalignment Achyuta Rajaram, Alex Makelov, Dan Mossing, Jeffrey Wang Published: 2025-06-24Area: Deception & FailureCitations: 27 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R4 (96%) | 27 |
| Why Do Some Language Models Fake Alignment While Others Don't? Abhay Sheshadri, Alex Mallen, Arun Jose, Fabien Roger Published: 2025-06-22Area: Deception & FailureCitations: 6 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (96%) | 6 |
| Out of Control - Why Alignment Needs Formal Control Theory (and an Alignment Control Stack) Elija Perrier Published: 2025-06-21Area: Formal/TheoreticalCitations: 2 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-06-21 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E4 / R2 (94%) | 2 |
| Resource Rational Contractualism Should Guide AI Alignment Daniel Kilov, Iason Gabriel, Joshua B. Tenenbaum, Lionel Wong Published: 2025-06-20Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-20 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 2 |
| Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models Biao Yi, Sishuo Chen, Tiansheng Huang, Tong Li Published: 2025-06-19Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 24 |
| Probing the Robustness of Large Language Models Safety to Latent Perturbations Jie Li, Kexin Huang, Tianle Gu, Yang Yao Published: 2025-06-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Empirical Evidence for Alignment Faking in Small LLMs and Prompt-Based Mitigation Techniques J. Koorndijk Published: 2025-06-17Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models James Chua, Jan Betley, Mia Taylor, Owain Evans Published: 2025-06-16Area: Deception & FailureCitations: 33 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 33 |
| Convergent Linear Representations of Emergent Misalignment Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2025-06-13Area: Representation AnalysisCitations: 22 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-13 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E4 / R3 (95%) | 22 |
| Model Organisms for Emergent Misalignment Anna Soligo, Edward Turner, Mia Taylor, Neel Nanda Published: 2025-06-13Area: Deception & FailureCitations: 30 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R5 (95%) | 30 |
| DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt Ge Li, Jia Li, Liyi Cai, Yitong Zhang Published: 2025-06-11Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (96%) | 3 |
| Multi-level Value Alignment in Agentic AI Systems: Survey and Perspectives Chuan Qin, Feimin Zhong, Han Wu, Hengshu Zhu Published: 2025-06-11Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-06-11 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E5 / R3 (93%) | 5 |
| AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin Hailiang Dai, Jiayu Yao, Jigang Wang, Kunpeng Ning Published: 2025-06-10Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, empirical | 2025-06-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment Jean-No毛l Vittaut, Marie-Jeanne Lesot, Milan Bhan, Nicolas Chesneau Published: 2025-06-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-06-10 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures Sibei Yang, Wenjie Wang, Yukai Zhou Published: 2025-06-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | 2 |
| Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Liwei Jiang, Mickel Liu, Natasha Jaques, Simon Shaolei Du Published: 2025-06-09Area: Alignment TrainingCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (98%) | 18 |
| QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA Aswin RRV, Ben Zhou, Chitta Baral, Jacob Dineen Published: 2025-06-09Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (96%) | 10 |
| Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints Austin Hoag, Blossom Metevier, Philip S. Thomas, Scott Niekum Published: 2025-06-09Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks Changick Kim, Seokil Ham, Seungju Cho, Younghun Kim Published: 2025-06-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts Alexandra Dmitrienko, Hamid Dashtbani, Torsten Krau脽 Published: 2025-06-09Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 12 |
| When Style Breaks Safety: Defending Language Models Against Superficial Style Alignment Marzyeh Ghassemi, Sana Tonekaboni, Vinith Suriyakumar, Walter Gerych Published: 2025-06-09Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values Ahmed Amer, Evan Harris, Nell Watson, Preeti Ravindra Published: 2025-06-08Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-06-08 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1 |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment Hyunbin Jin, Kyubyung Chae, Taesup Kim Published: 2025-06-07Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |