Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Provably Convergent Primal-Dual DPO for Constrained LLM Alignment R. Srikant, Seo Taek Kong, Yihan Du Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (95%) | - |
| Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment Heng Huang, Junyi Li, Peiran Yu, Ziyi Chen Published: 2025-10-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-10-07 | Alignment Training | ai-safety, alignment-training, theoretical | E7 / R4 (96%) | - |
| Refusal Falls Off a Cliff: How Safety Alignment Fails in Reasoning? Chak Tou Leong, Jaehong Yoon, Jinjin Gu, Linyi Yang Published: 2025-10-07Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-07 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 2 |
| The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna Published: 2025-10-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Adapting Insider Risk mitigations for Agentic Misalignment: an empirical study Francesca Gomez Published: 2025-10-06Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-06 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails Cihang Xie, Huaxiu Yao, Jiaqi Liu, Kaiwen Xiong Published: 2025-10-06Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-06 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R4 (95%) | 1 |
| Imperceptible Jailbreaking against Large Language Models Chao Du, Kuofeng Gao, Shu-Tao Xia, Tianyu Pang Published: 2025-10-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 1 |
| Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment Alex Mallen, Aram Ebtekar, Ariana Azarbal, Christine Ye Published: 2025-10-06Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Agentic Misalignment: How LLMs Could Be Insider Threats Aengus Lynch, Benjamin Wright, Caleb Larson, Ethan Perez Published: 2025-10-05Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-05 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| InvThink: Towards AI Safety via Inverse Reasoning Chunjong Park, Cynthia Breazeal, Daniel McDuff, Eugene Park Published: 2025-10-02Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 1 |
| Large Reasoning Models Learn Better Alignment from Flawed Thinking Duen Horng Chau, Eric Smith, Haozhu Wang, Hongyuan Zhan Published: 2025-10-01Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards Jonathan Chang, Prithviraj Ammanabrolu, Yiran Shen, Yu Xia Published: 2025-10-01Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (97%) | 3 |
| Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability Jun Sakuma, Shojiro Yamabe Published: 2025-10-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF Jing Liu Published: 2025-09-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, interpretability, theoretical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, interpretability, theoretical | E5 / R3 (94%) | - |
| OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment Dongrui Liu, Guibin Zhang, Huahui Yi, Jian Zhao Published: 2025-09-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention Dongbai Li, Hang Su, Jingwen Yang, Jun Zhu Published: 2025-09-29Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 2 |
| VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models Mansi Phute, Ravikumar Balakrishnan Published: 2025-09-29Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-09-29 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Toward Preference-aligned Large Language Models via Residual-based Model Steering Andrea Tagarelli, Lucio La Cava Published: 2025-09-28Area: Representation AnalysisCitations: - Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (94%) | - |
| A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models Albert No, Dongjae Jeon, Hyesoo Hong, Sangwoo Shin Published: 2025-09-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models Min-Hsuan Yeh, Xuanming Zhang, Yixuan Li, Yuxuan Chen Published: 2025-09-27Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-09-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 3 |
| OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language Isa Inuwa-Dutse Published: 2025-09-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-09-26 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| The Rogue Scalpel: Activation Steering Compromises LLM Safety Alexey Dontsov, Andrey Galichin, Anton Korznikov, Elena Tutubalina Published: 2025-09-26Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 4 |
| We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-26Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-26 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 2 |
| Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training Bing Liu, Jaehwan Jeong, Junkai Zhang, Lifeng Jin Published: 2025-09-25Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, empirical | 2025-09-25 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 11 |
| Preemptive Detection and Steering of LLM Misalignment via Latent Reachability Sathwik Karnik, Somil Bansal Published: 2025-09-25Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| Who is In Charge? Dissecting Role Conflicts in Instruction Following Siqi Zeng Published: 2025-09-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-09-23 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R4 (92%) | - |
| LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization Bihao Zhan, Jie Zhou, Junsong Li, Liang He Published: 2025-09-21Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots Amir M. Rahmani, Chenhan Lyu, Pengfei Zhang, Yutong Song Published: 2025-09-19Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-09-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Stress Testing Deliberative Alignment for Anti-Scheming Training Alexander Meinke, Alex Lloyd, Amelia Glaese, Andrei Matveiakin Published: 2025-09-19Area: Deception & FailureCitations: 26 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (94%) | 26 |