Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance Jian Liu, Jian Lou, Jiawen Zhang, Kejia Chen Published: 2026-01-05Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-05 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (97%) | 1 |
| Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment Huizhong Song, Jiye Liang, Jun Wang, Lijun Zhang Published: 2025-12-30Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance Anningzhe Gao, Erchao Zhao, Feifei Tong, Guanjun Jiang Published: 2025-12-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 1 |
| Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation Dianyun Wang, Huijia Wu, Lechen Ning, Qingsen Ma Published: 2025-12-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (98%) | - |
| Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs Anastasia Giachanou, Hadi Mohammadi, Tam谩s Koz谩k Published: 2025-12-27Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents Benjamin C. M. Fung, Claude Fachkha, Khalil Al-Hussaeni, Martin Weiss Published: 2025-12-23Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-12-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (98%) | 2 |
| Offline Safe Policy Optimization From Heterogeneous Feedback Akshat Kumar, Pradeep Varakantham, Ze Gong Published: 2025-12-23Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Safety Alignment of LMs via Non-cooperative Games Anselm Paulus, Arman Zharmagambetov, Brandon Amos, Ilia Kulikov Published: 2025-12-23Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Explainable Reinforcement Learning from Human Feedback to Improve Alignment Hangfan Zhang, Minghui Zhu, Shicheng Liu, Siyuan Xu Published: 2025-12-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization Dongyi Liu, Han Xiao, Jia Li, Nuo Chen Published: 2025-12-12Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously Andrew Adiletta, Berk Sunar, Kathryn Adiletta, Kemal Derya Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs Ruimin Sun, Sohely Jahan Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment Guangkai Jiang, Siavash H. Khajavai, Xinru Liu, Zixuan Liu Published: 2025-12-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning Adel Bibi, Bernard Ghanem, Hani Itani, Hasan Abed Al Kader Hammoud Published: 2025-12-10Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| A Geometric Unification of Concept Learning with Concept Cones Alexandre Rocchi-Henry, Gianni Franchi, Thomas Fel Published: 2025-12-08Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, mechanistic-interp, theoretical | 2025-12-08 | Mechanistic Interp. | ai-safety, alignment-training, mechanistic-interp, theoretical | E5 / R4 (94%) | - |
| Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models Chaochao Lu, Fenghua Weng, Wenjie Wang, Wenqi Shao Published: 2025-12-08Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-12-08 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Training LLMs for Honesty via Confessions Amelia Glaese, Boaz Barak, Gabriel Wu, Jasmine Wang Published: 2025-12-08Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-12-08 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models Animesh Mukherjee, Mykola Pechenizkiy, Rima Hazra, Sayan Layek Published: 2025-12-06Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-12-06 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models Andrew Bai, Cho-Jui Hsieh, Haoyu Li, Tong Xie Published: 2025-12-06Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment Jad Tarifi, Nataliia Babina, Nima Asgharbeygi, Panatchakorn Anantaprayoon Published: 2025-12-05Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-05 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (97%) | - |
| Matching Ranks Over Probability Yields Truly Deep Safety Alignment Gagandeep Singh, Jason Vega Published: 2025-12-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective Anne Lauscher, Jae Hee Lee, Stefano V. Albrecht Published: 2025-12-04Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | 2025-12-04 | Agent Safety | agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | E5 / R3 (94%) | 1 |
| Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment Devashish Khatwani, Hal Daum茅 III, Huy Nghiem, Huy V. Nguyen Published: 2025-12-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-03 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe - Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space Aman Chadha, Amitava Das, Saksham Aggarwal, Samarth Raina Published: 2025-12-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-03 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value Andreas Haupt, Andrew Koh, Atoosa Kasirzadeh, Atrisha Sarkar Published: 2025-12-03Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, position | 2025-12-03 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 2 |
| In-Context Representation Hijacking Amir Sarid, Itay Yona, Michael Karasik, Yossi Gandelsman Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability Jinghan Jia, Nathalie Baracaldo, Sijia Liu Published: 2025-12-01Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-01 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li Published: 2025-11-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs Arijit Ghosh Chowdhury, Dongkyu Derek Cho, Hannah Marlowe, Haotian An Published: 2025-11-26Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines Dongyuan Lu, Jitao Sang, Yanxu Zhu, Yuhang Wang Published: 2025-11-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |