Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Atlas-Alignment: Making Interpretability Transferable Across Language Models Bruno Puri, Jim Berend, Sebastian Lapuschkin, Wojciech Samek Published: 2025-10-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-10-31 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | - |
| Consistency Training Helps Stop Sycophancy and Jailbreaks Alexander Matt Turner, Alex Irpan, David K. Elson, Mark Kurzeja Published: 2025-10-31Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy Mohsen Bayati, William Overman Published: 2025-10-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-10-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| Value Drifts: Tracing Value Alignment During LLM Post-Training Gaurav Kamath, Karolina Sta艅czak, Marius Mosbach, Mehar Bhatia Published: 2025-10-30Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E9 / R4 (96%) | 3 |
| What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data Emma Pierson, Rajiv Movva, Sewon Min, Smitha Milli Published: 2025-10-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Debiasing Reward Models by Representation Learning with Guarantees Ignavier Ng, Kun Zhang, Patrick Bl枚baum, Shiva Kasiviswanathan Published: 2025-10-27Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-10-27 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference Aidan Li, Rob Brekelmans, Roger Grosse, Stephen Zhao Published: 2025-10-24Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-24 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Ask a Strong LLM Judge when Your Reward Model is Uncertain Changlong Yu, Haoming Jiang, Hyokun Yun, Ilgee Hong Published: 2025-10-23Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-10-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training Stephen H. Bach, Zheng-Xin Yong Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Subliminal Corruption: Mechanisms, Thresholds, and Interpretability Reya Vir, Sarvesh Bhatnagar Published: 2025-10-22Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical, interpretability | 2025-10-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, interpretability | E5 / R3 (95%) | 1 |
| Extracting alignment data in open models Chawin Sitawarin, Christopher A. Choquette-Choo, Federico Barbero, Ilia Shumailov Published: 2025-10-21Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-21 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 3 |
| Rectifying Shortcut Behaviors in Preference-based Reward Learning Aidong Zhang, Guangtao Zheng, Wenqian Ye Published: 2025-10-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth Andrew Estornell, Bo Li, David D. Baek, Jiawei Zhang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs Chao Deng, Chong Long, Di Jin, Duqing Wang Published: 2025-10-20Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment Jing Shao, Lijun Li, Xingjun Wang, Yuexiao Liu Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL Aryansh Shrivastava, Marwa Abdulhai, Natasha Jaques, Ryan Cheng Published: 2025-10-16Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (96%) | 1 |
| AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs Denise Alejandra Mester, Eitan Sprejer, Facundo Nieto, Francisca Gauna Selasco Published: 2025-10-15Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-10-15 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (93%) | - |
| Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment Boxuan Wang, Guangliang Cheng, Jinwei Hu, Lokesh Singh Published: 2025-10-15Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, position | 2025-10-15 | Agent Safety | agent-safety, ai-safety, alignment-training, position | E4 / R3 (92%) | 4 |
| Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers Claudia Soares, Marta Guimaraes, Ruben Belo Published: 2025-10-14Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | - |
| Repairing Reward Functions with Feedback to Mitigate Reward Hacking Emma Brunskill, Logan Mondal Bhamidipaty, Stephane Hatgis-Kessell Published: 2025-10-14Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures? Florian Mai, Leonard Dung Published: 2025-10-13Area: Formal/TheoreticalCitations: - Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-10-13 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E8 / R2 (97%) | - |
| Deep Research Brings Deeper Harm Bailan He, Georg Groh, Haokun Chen, Jindong Gu Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs Alexander Panchenko, Ashwinee Panda, Elena Tutubalina, Kevin Zhu Published: 2025-10-13Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | 4 |
| PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration Di Wang, Hongji Li, Lijie Hu, Manjiang Yu Published: 2025-10-11Area: Model EditingCitations: 7 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 7 |
| Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models Shikun Zhang, Wei Ye, Xiaoling Zhou, Yutao Mou Published: 2025-10-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search Guangze Zhao, MingSheng Li, Sichen Liu Published: 2025-10-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions Dongrui Liu, Jing Shao, Peng Wang, Xiaoya Lu Published: 2025-10-09Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| The Alignment Waltz: Jointly Training Agents to Collaborate for Safety Amr Sharaf, Benjamin Van Durme, Daniel Khashabi, Eric Michael Smith Published: 2025-10-09Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R5 (94%) | 3 |
| The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs Ali Khalil, Buddhika Laknath Semage, Omar Mahmoud, Santu Rana Published: 2025-10-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| On the Convergence of Moral Self-Correction in Large Language Models Bochuan Cao, Guangliang Liu, Haitao Mao, Kristen Marie Johnson Published: 2025-10-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |