Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment Jean-No毛l Vittaut, Marie-Jeanne Lesot, Milan Bhan, Nicolas Chesneau Published: 2025-06-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-06-10 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt Ge Li, Jia Li, Liyi Cai, Yitong Zhang Published: 2025-06-11Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (96%) | 3 |
| Multi-level Value Alignment in Agentic AI Systems: Survey and Perspectives Chuan Qin, Feimin Zhong, Han Wu, Hengshu Zhu Published: 2025-06-11Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-06-11 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E5 / R3 (93%) | 5 |
| Convergent Linear Representations of Emergent Misalignment Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2025-06-13Area: Representation AnalysisCitations: 22 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-13 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E4 / R3 (95%) | 22 |
| Model Organisms for Emergent Misalignment Anna Soligo, Edward Turner, Mia Taylor, Neel Nanda Published: 2025-06-13Area: Deception & FailureCitations: 30 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R5 (95%) | 30 |
| Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models James Chua, Jan Betley, Mia Taylor, Owain Evans Published: 2025-06-16Area: Deception & FailureCitations: 33 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 33 |
| Empirical Evidence for Alignment Faking in Small LLMs and Prompt-Based Mitigation Techniques J. Koorndijk Published: 2025-06-17Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models Biao Yi, Sishuo Chen, Tiansheng Huang, Tong Li Published: 2025-06-19Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 24 |
| Probing the Robustness of Large Language Models Safety to Latent Perturbations Jie Li, Kexin Huang, Tianle Gu, Yang Yao Published: 2025-06-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Resource Rational Contractualism Should Guide AI Alignment Daniel Kilov, Iason Gabriel, Joshua B. Tenenbaum, Lionel Wong Published: 2025-06-20Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-20 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 2 |
| Out of Control - Why Alignment Needs Formal Control Theory (and an Alignment Control Stack) Elija Perrier Published: 2025-06-21Area: Formal/TheoreticalCitations: 2 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-06-21 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E4 / R2 (94%) | 2 |
| Why Do Some Language Models Fake Alignment While Others Don't? Abhay Sheshadri, Alex Mallen, Arun Jose, Fabien Roger Published: 2025-06-22Area: Deception & FailureCitations: 6 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (96%) | 6 |
| Inference-Time Reward Hacking in Large Language Models Alex Oesterling, Claudio Mayrink Verdun, Flavio du Pin Calmon, Hadi Khalaf Published: 2025-06-24Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | 4 |
| Persona Features Control Emergent Misalignment Achyuta Rajaram, Alex Makelov, Dan Mossing, Jeffrey Wang Published: 2025-06-24Area: Deception & FailureCitations: 27 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R4 (96%) | 27 |
| Linearly Decoding Refused Knowledge in Aligned Language Models Ari Holtzman, Aryan Shrivastava Published: 2025-06-30Area: Representation AnalysisCitations: 2 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-30 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R4 (92%) | 2 |
| LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance Igor Ivanov Published: 2025-06-30Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (97%) | 1 |
| Discourse Heuristics For Paradoxically Moral Self-Correction Guangliang Liu, Kristen Marie Johnson, Xitong Zhang, Zimo Qi Published: 2025-07-01Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| SAFER: Probing Safety in Reward Models with Sparse Autoencoder Guojun Ma, Sihang Li, Tao Liang, Wei Shi Published: 2025-07-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-07-01 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (96%) | 2 |
| Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs Jeremiah Giordani Published: 2025-07-04Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| Interpretable Reward Modeling with Active Concept Bottlenecks Julia E. Vogt, Katarzyna Kobalczyk, Mihaela van der Schaar, Sonia Laguna Published: 2025-07-07Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message Li Qian, Wei Duan Published: 2025-07-07Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E4 / R3 (95%) | - |
| Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation Haoyu Wang, Kailong Wang, Ling Shi, Shuai Yuan Published: 2025-07-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 1 |
| TuneShield: Mitigating Toxicity in Conversational AI while Fine-tuning on Untrusted Data Aravind Cheruvu, Bimal Viswanath, Daphne Yao, Murtuza Jadliwala Published: 2025-07-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment Frauke Kreuter, Greg Gluch, Guy N. Rothblum, Omer Reingold Published: 2025-07-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (97%) | 4 |
| Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Chen Luo, Fali Wang, Hui Liu, Jingying Zeng Published: 2025-07-10Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| The Non-Linear Representation Dilemma: Is Causal Abstraction Enough for Mechanistic Interpretability? Denis Sutter, Julian Minder, Thomas Hofmann, Tiago Pimentel Published: 2025-07-11Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 11 |
| PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training Pengfei Du Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | E5 / R3 (95%) | 2 |
| Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities Michael Backes, Yang Zhang, Yiting Qu Published: 2025-07-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-15 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (98%) | 1 |
| Internal Value Alignment in Large Language Models through Controlled Value Vector Activation Defu Lian, Haoran Jin, Meng Li, Minlie Huang Published: 2025-07-15Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | 3 |
| The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs Chaochao Lu, Conghui He, Dongrui Liu, Haoyun Xu Published: 2025-07-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |