Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models Animesh Mukherjee, Mykola Pechenizkiy, Rima Hazra, Sayan Layek Published: 2025-12-06Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-12-06 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models Andrew Bai, Cho-Jui Hsieh, Haoyu Li, Tong Xie Published: 2025-12-06Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| A Geometric Unification of Concept Learning with Concept Cones Alexandre Rocchi-Henry, Gianni Franchi, Thomas Fel Published: 2025-12-08Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, mechanistic-interp, theoretical | 2025-12-08 | Mechanistic Interp. | ai-safety, alignment-training, mechanistic-interp, theoretical | E5 / R4 (94%) | - |
| Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models Chaochao Lu, Fenghua Weng, Wenjie Wang, Wenqi Shao Published: 2025-12-08Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-12-08 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Training LLMs for Honesty via Confessions Amelia Glaese, Boaz Barak, Gabriel Wu, Jasmine Wang Published: 2025-12-08Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-12-08 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs Ruimin Sun, Sohely Jahan Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment Guangkai Jiang, Siavash H. Khajavai, Xinru Liu, Zixuan Liu Published: 2025-12-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning Adel Bibi, Bernard Ghanem, Hani Itani, Hasan Abed Al Kader Hammoud Published: 2025-12-10Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization Dongyi Liu, Han Xiao, Jia Li, Nuo Chen Published: 2025-12-12Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously Andrew Adiletta, Berk Sunar, Kathryn Adiletta, Kemal Derya Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Explainable Reinforcement Learning from Human Feedback to Improve Alignment Hangfan Zhang, Minghui Zhu, Shicheng Liu, Siyuan Xu Published: 2025-12-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents Benjamin C. M. Fung, Claude Fachkha, Khalil Al-Hussaeni, Martin Weiss Published: 2025-12-23Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-12-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (98%) | 2 |
| Offline Safe Policy Optimization From Heterogeneous Feedback Akshat Kumar, Pradeep Varakantham, Ze Gong Published: 2025-12-23Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Safety Alignment of LMs via Non-cooperative Games Anselm Paulus, Arman Zharmagambetov, Brandon Amos, Ilia Kulikov Published: 2025-12-23Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs Anastasia Giachanou, Hadi Mohammadi, Tam谩s Koz谩k Published: 2025-12-27Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance Anningzhe Gao, Erchao Zhao, Feifei Tong, Guanjun Jiang Published: 2025-12-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 1 |
| Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation Dianyun Wang, Huijia Wu, Lechen Ning, Qingsen Ma Published: 2025-12-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (98%) | - |
| Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment Huizhong Song, Jiye Liang, Jun Wang, Lijun Zhang Published: 2025-12-30Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance Jian Liu, Jian Lou, Jiawen Zhang, Kejia Chen Published: 2026-01-05Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-05 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (97%) | 1 |
| Learning to Diagnose and Correct Moral Errors: Towards Enhancing Moral Sensitivity in Large Language Models Bocheng Chen, Guangliang Liu, Han Zi, Kristen Johnson Published: 2026-01-06Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning Ahmed Y. Radwan, Azib Farooq, Shaina Raza, Sindhuja Chaduvula Published: 2026-01-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms Jun Sun, Ruihan Zhang Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| MiJaBench: Revealing Minority Biases in Large Language Models via Hate Speech Jailbreaking Arlindo R. Galv茫o Filho, Diogo F. C. Silva, Iago A. Brito, Julia S. Dollis Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-07 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R3 (95%) | - |
| Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis Chenfu Bao, Du Su, Guoqiu Wang, Jinchang Hou Published: 2026-01-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | - |
| STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules Bing Qin, Di Wu, Mingzhe Li, Xin Lu Published: 2026-01-07Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (99%) | 1 |
| What Matters For Safety Alignment? Hui-Ling Zhen, Lihao Yin, Mingxuan Yuan, Xianzhi Yu Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (93%) | - |
| When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life Fengran Mo, Jinan Xu, Jingyi Yin, Kaiyu Huang Published: 2026-01-07Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, benchmark, multimodal-safety | 2026-01-07 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety | E4 / R2 (94%) | - |
| AM3Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs Chengkun Cai, Chi-Min Chan, Han Zhu, Haoran Li Published: 2026-01-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity Chi Zhang, Hongjun An, Jiangan Chen, Jiawei Shao Published: 2026-01-10Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-10 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| When Should We Introduce Safety Interventions During Pretraining? Alexander Robey, Dylan Sam, J. Zico Kolter, Pratyush Maini Published: 2026-01-11Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-11 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (92%) | - |