Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models Min-Hsuan Yeh, Xuanming Zhang, Yixuan Li, Yuxuan Chen Published: 2025-09-27Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-09-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 3 |
| Toward Preference-aligned Large Language Models via Residual-based Model Steering Andrea Tagarelli, Lucio La Cava Published: 2025-09-28Area: Representation AnalysisCitations: - Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (94%) | - |
| Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF Jing Liu Published: 2025-09-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, interpretability, theoretical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, interpretability, theoretical | E5 / R3 (94%) | - |
| OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment Dongrui Liu, Guibin Zhang, Huahui Yi, Jian Zhao Published: 2025-09-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention Dongbai Li, Hang Su, Jingwen Yang, Jun Zhu Published: 2025-09-29Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 2 |
| VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models Mansi Phute, Ravikumar Balakrishnan Published: 2025-09-29Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-09-29 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Large Reasoning Models Learn Better Alignment from Flawed Thinking Duen Horng Chau, Eric Smith, Haozhu Wang, Hongyuan Zhan Published: 2025-10-01Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards Jonathan Chang, Prithviraj Ammanabrolu, Yiran Shen, Yu Xia Published: 2025-10-01Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (97%) | 3 |
| Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability Jun Sakuma, Shojiro Yamabe Published: 2025-10-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| InvThink: Towards AI Safety via Inverse Reasoning Chunjong Park, Cynthia Breazeal, Daniel McDuff, Eugene Park Published: 2025-10-02Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 1 |
| Agentic Misalignment: How LLMs Could Be Insider Threats Aengus Lynch, Benjamin Wright, Caleb Larson, Ethan Perez Published: 2025-10-05Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-05 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| Adapting Insider Risk mitigations for Agentic Misalignment: an empirical study Francesca Gomez Published: 2025-10-06Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-06 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails Cihang Xie, Huaxiu Yao, Jiaqi Liu, Kaiwen Xiong Published: 2025-10-06Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-06 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R4 (95%) | 1 |
| Imperceptible Jailbreaking against Large Language Models Chao Du, Kuofeng Gao, Shu-Tao Xia, Tianyu Pang Published: 2025-10-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 1 |
| Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment Alex Mallen, Aram Ebtekar, Ariana Azarbal, Christine Ye Published: 2025-10-06Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Provably Convergent Primal-Dual DPO for Constrained LLM Alignment R. Srikant, Seo Taek Kong, Yihan Du Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (95%) | - |
| Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment Heng Huang, Junyi Li, Peiran Yu, Ziyi Chen Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E7 / R4 (96%) | - |
| Refusal Falls Off a Cliff: How Safety Alignment Fails in Reasoning? Chak Tou Leong, Jaehong Yoon, Jinjin Gu, Linyi Yang Published: 2025-10-07Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-07 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 2 |
| The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna Published: 2025-10-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| On the Convergence of Moral Self-Correction in Large Language Models Bochuan Cao, Guangliang Liu, Haitao Mao, Kristen Marie Johnson Published: 2025-10-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions Dongrui Liu, Jing Shao, Peng Wang, Xiaoya Lu Published: 2025-10-09Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| The Alignment Waltz: Jointly Training Agents to Collaborate for Safety Amr Sharaf, Benjamin Van Durme, Daniel Khashabi, Eric Michael Smith Published: 2025-10-09Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R5 (94%) | 3 |
| The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs Ali Khalil, Buddhika Laknath Semage, Omar Mahmoud, Santu Rana Published: 2025-10-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models Shikun Zhang, Wei Ye, Xiaoling Zhou, Yutao Mou Published: 2025-10-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search Guangze Zhao, MingSheng Li, Sichen Liu Published: 2025-10-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration Di Wang, Hongji Li, Lijie Hu, Manjiang Yu Published: 2025-10-11Area: Model EditingCitations: 7 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 7 |
| AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures? Florian Mai, Leonard Dung Published: 2025-10-13Area: Formal/TheoreticalCitations: - Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-10-13 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E8 / R2 (97%) | - |
| Deep Research Brings Deeper Harm Bailan He, Georg Groh, Haokun Chen, Jindong Gu Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs Alexander Panchenko, Ashwinee Panda, Elena Tutubalina, Kevin Zhu Published: 2025-10-13Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | 4 |
| Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers Claudia Soares, Marta Guimaraes, Ruben Belo Published: 2025-10-14Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | - |