Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety Can Jin, Dimitris N. Metaxas, Hongwu Peng, Jiahui Zhao Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment Dandan Guo, Haozhong Wang, He Zhao, Hongyuan Zha Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling Weiqiang Zheng, Yang Cai Published: 2026-01-13Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-13 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment Geng Yuan, Lingzi Hong, Ninghao Liu, Ningxi Cheng Published: 2026-01-13Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation Abdelaziz Bounhar, Guokan Shang, Hadi Abdine, Michalis Vazirgiannis Published: 2026-01-13Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2026-01-13 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (98%) | - |
| Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay Hao Li, Hao Wang, Lei Sha, Rui Li Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (96%) | - |
| Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment Felix Jahn, Kevin Baum, Lisa Dargasz, Patrick Schramowski Published: 2026-01-15Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-01-15 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R4 (96%) | - |
| ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack Chaowei Xiao, G. Edward Suh, Hao Li, Ning Zhang Published: 2026-01-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Understanding and Preserving Safety in Fine-Tuned LLMs Dan Li, Jiachen Ma, Jian Liu, Jian Lou Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion Cen Chen, Guanghao Zhou, Hongyu Li, Jun Zhou Published: 2026-01-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift Daniel Vennemeyer, Michael Umeokoli, Phan Anh Duong, Punya Syon Pandey Published: 2026-01-19Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (97%) | - |
| Simple Role Assignment is Extraordinarily Effective for Safety Alignment Demetri Terzopoulos, Fangwei Zhong, Jiakun Ding, Junqi Wang Published: 2026-01-20Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| VirtualCrime: Evaluating Criminal Potential of Large Language Models via Sandbox Simulation Baicheng Chen, Lanlan Qiu, Tianxing He, Wenchang Gao Published: 2026-01-20Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R4 (97%) | 1 |
| Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions Usman Naseem Published: 2026-01-21Area: Surveys & ReviewsCitations: 1 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2026-01-21 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E6 / R4 (96%) | 1 |
| The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents Chen Chen, Kim Young Il, Kwok-Yan Lam, Qian Wang Published: 2026-01-24Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, benchmark | 2026-01-24 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | - |
| The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment Marco Pollanen Published: 2026-01-24Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Unsupervised Elicitation of Moral Values from Language Models Fabrizio Gilardi, Meysam Alizadeh, Zeynab Samei Published: 2026-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-25 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values Bochu Ding, Brandon Fain, Henry Bell, Lara Neubauer da Costa Schertel Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing Akanksha Dadlani, Darja Djordjevic, Duncan Eddy, Eugenia Kim Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale Brandon Fain, Caroline Zhang, Dhaval Potdar, Henry Bell Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (95%) | - |
| TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment Duohe Ma, Huiyan Jin, Jianfeng Si, Jiawen Tao Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R5 (96%) | - |
| LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment Dongxia Wang, Haonan Zhang, Kexin Chen, Wenhai Wang Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | - |
| Reward Models Inherit Value Biases from Pretraining Brian Christian, Christopher Summerfield, Elle Michelle Yang, Hannah Rose Kirk Published: 2026-01-28Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| Factored Causal Representation Learning for Robust Reward Modeling in RLHF Biwei Huang, Fan Feng, Lei Xu, Lin Qu Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| Shaping capabilities with token-level data filtering Alec Radford, Neil Rathi Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning Abhishek Mishra, Deepesh Suranjandass, Donnie Winkelmann, Mugilan Arulvanan Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures Jie Zhang, Nenghai Yu, Qiu Han, Tianwei Zhang Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Real-Time Aligned Reward Model beyond Semantics Deqing Wang, Fuzhen Zhuang, Hongyan Xie, Jianbin Zheng Published: 2026-01-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| The Alignment Curse: Cross-Modality Jailbreak Transfer in Omni-Models Adel Bibi, Aoxi Liu, Junchi Yu, Philip Torr Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (92%) | - |