Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale Brandon Fain, Caroline Zhang, Dhaval Potdar, Henry Bell Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (95%) | - |
| TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment Duohe Ma, Huiyan Jin, Jianfeng Si, Jiawen Tao Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R5 (96%) | - |
| Unsupervised Elicitation of Moral Values from Language Models Fabrizio Gilardi, Meysam Alizadeh, Zeynab Samei Published: 2026-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-25 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents Chen Chen, Kim Young Il, Kwok-Yan Lam, Qian Wang Published: 2026-01-24Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, benchmark | 2026-01-24 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | - |
| The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment Marco Pollanen Published: 2026-01-24Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions Usman Naseem Published: 2026-01-21Area: Surveys & ReviewsCitations: 1 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2026-01-21 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E6 / R4 (96%) | 1 |
| Simple Role Assignment is Extraordinarily Effective for Safety Alignment Demetri Terzopoulos, Fangwei Zhong, Jiakun Ding, Junqi Wang Published: 2026-01-20Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| VirtualCrime: Evaluating Criminal Potential of Large Language Models via Sandbox Simulation Baicheng Chen, Lanlan Qiu, Tianxing He, Wenchang Gao Published: 2026-01-20Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R4 (97%) | 1 |
| LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion Cen Chen, Guanghao Zhou, Hongyu Li, Jun Zhou Published: 2026-01-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift Daniel Vennemeyer, Michael Umeokoli, Phan Anh Duong, Punya Syon Pandey Published: 2026-01-19Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (97%) | - |
| Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay Hao Li, Hao Wang, Lei Sha, Rui Li Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (96%) | - |
| Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment Felix Jahn, Kevin Baum, Lisa Dargasz, Patrick Schramowski Published: 2026-01-15Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-01-15 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R4 (96%) | - |
| ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack Chaowei Xiao, G. Edward Suh, Hao Li, Ning Zhang Published: 2026-01-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Understanding and Preserving Safety in Fine-Tuned LLMs Dan Li, Jiachen Ma, Jian Liu, Jian Lou Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling Weiqiang Zheng, Yang Cai Published: 2026-01-13Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-13 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment Geng Yuan, Lingzi Hong, Ninghao Liu, Ningxi Cheng Published: 2026-01-13Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation Abdelaziz Bounhar, Guokan Shang, Hadi Abdine, Michalis Vazirgiannis Published: 2026-01-13Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2026-01-13 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (98%) | - |
| Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety Can Jin, Dimitris N. Metaxas, Hongwu Peng, Jiahui Zhao Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment Dandan Guo, Haozhong Wang, He Zhao, Hongyuan Zha Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| When Should We Introduce Safety Interventions During Pretraining? Alexander Robey, Dylan Sam, J. Zico Kolter, Pratyush Maini Published: 2026-01-11Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-11 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (92%) | - |
| Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity Chi Zhang, Hongjun An, Jiangan Chen, Jiawei Shao Published: 2026-01-10Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-10 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| AM3Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs Chengkun Cai, Chi-Min Chan, Han Zhu, Haoran Li Published: 2026-01-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| MiJaBench: Revealing Minority Biases in Large Language Models via Hate Speech Jailbreaking Arlindo R. Galv茫o Filho, Diogo F. C. Silva, Iago A. Brito, Julia S. Dollis Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-07 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R3 (95%) | - |
| Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis Chenfu Bao, Du Su, Guoqiu Wang, Jinchang Hou Published: 2026-01-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | - |
| STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules Bing Qin, Di Wu, Mingzhe Li, Xin Lu Published: 2026-01-07Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (99%) | 1 |
| What Matters For Safety Alignment? Hui-Ling Zhen, Lihao Yin, Mingxuan Yuan, Xianzhi Yu Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (93%) | - |
| When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life Fengran Mo, Jinan Xu, Jingyi Yin, Kaiyu Huang Published: 2026-01-07Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, benchmark, multimodal-safety | 2026-01-07 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety | E4 / R2 (94%) | - |
| Learning to Diagnose and Correct Moral Errors: Towards Enhancing Moral Sensitivity in Large Language Models Bocheng Chen, Guangliang Liu, Han Zi, Kristen Johnson Published: 2026-01-06Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning Ahmed Y. Radwan, Azib Farooq, Shaina Raza, Sindhuja Chaduvula Published: 2026-01-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms Jun Sun, Ruihan Zhang Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |