Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| References Improve LLM Alignment in Non-Verifiable Domains Alexander R. Fabbri, Arman Cohan, Kejian Shi, Peifeng Wang Published: 2026-02-18Area: cs.CLCitations: 15 Tags: ai-safety, alignment-training, cscl, preprint | 2026-02-18 | cs.CL | ai-safety, alignment-training, cscl, preprint | E17 / R8 (92%) | 15 |
| Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation Hiroki Fukui Published: 2026-02-17Area: cs.CYCitations: 15 Tags: ai-safety, alignment-training, cscy, preprint, safety-evaluation | 2026-02-17 | cs.CY | ai-safety, alignment-training, cscy, preprint, safety-evaluation | E12 / R7 (92%) | 15 |
| GMAIL: Generative Modality Alignment for generated Image Learning Shentong Mo, Sukmin Yun Published: 2026-02-17Area: cs.CVCitations: 45 Tags: ai-safety, alignment-training, cscv, preprint | 2026-02-17 | cs.CV | ai-safety, alignment-training, cscv, preprint | E8 / R6 (92%) | 45 |
| Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment David Lagnado, Maria Victoria Carro Published: 2026-02-17Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-02-17 | cs.AI | ai-safety, alignment-training, csai, preprint | E9 / R7 (92%) | - |
| Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment Alireza Hashemi, Asad A. Butt, Heinrich Peters, James Rae Published: 2026-02-17Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E9 / R8 (93%) | - |
| Relative Geometry of Neural Forecasters: Linking Accuracy and Alignment in Learned Latent Geometry Christian Deubel, Deniz Kucukahmetler, Diaaeldin Taha, Julian Mosig von Aehrenfeld Published: 2026-02-17Area: cs.LGCitations: 15 Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E10 / R8 (90%) | 15 |
| The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety Aleksandra Korolova, Blossom Metevier, Bohdan Turbal, Chung Peng Lee Published: 2026-02-17Area: cs.LGCitations: 65 Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E8 / R8 (95%) | 65 |
| Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment Elias Malomgr茅, Pieter Simoens Published: 2026-02-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (97%) | - |
| AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks Chong Xiang, Neil Zhenqiang Gong, Ruiqi Wang, Xilong Wang Published: 2026-02-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Capability-Oriented Training Induced Alignment Risk Han Bao, Kehan Guo, Nitesh V Chawla, Nuno Moniz Published: 2026-02-12Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-12 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (94%) | 1 |
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Unifying Stable Optimization and Reference Regularization in RLHF Dadong Wang, He Zhao, Li He, Lina Yao Published: 2026-02-12Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2026-02-12 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling Bo Chen, Dandan Guo, Guowei Rong, Mingyuan Zhou Published: 2026-02-11Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment Junhao Dong, Kun Wang, Kun Yang, Qiankun Li Published: 2026-02-10Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-10 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies Chaozhuo Li, Chenxu Wang, Jinyu Hou, Ji Qi Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E4 / R3 (95%) | - |
| Trustworthy Agentic AI Requires Deterministic Architectural Boundaries Manish Bhattarai, Minh Vu Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | - |
| Robust Policy Optimization to Prevent Catastrophic Forgetting Adel Javanmard, George Pappas, Hamed Hassani, Mahdi Sabbaghi Published: 2026-02-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Stress-Testing Alignment Audits With Prompt-Level Strategic Deception Ben Marlin, David Lindner, Oliver Daniels, Perusha Moodley Published: 2026-02-09Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-02-09 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| Emergent Misalignment is Easy, Narrow Misalignment is Hard Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms Adith N Reganti, Bagesh Kumar, Hardik Sharma, Soham Wasmatkar Published: 2026-02-08Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-08 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R4 (96%) | - |
| Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities Majid Ghasemi, Mark Crowley Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (96%) | - |
| Robustness of Vision Language Models Against Split-Image Harmful Input Attacks Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Shagufta Mehnaz, Vishnu Asutosh Dasu Published: 2026-02-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection Guanglong Sun, Hang Su, Jun Zhu, Liyuan Wang Published: 2026-02-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| Controllable Value Alignment in Large Language Models through Neuron-Level Editing Fengbin Zhu, Jilong Liu, Junwei Li, Le Wu Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery Bangwei Guo, Difei Gu, Dimitris Metaxas, Gerasimos Chatzoudis Published: 2026-02-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2026-02-07 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | - |
| Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control Jilong Liu, Junfeng Fang, Le Wu, Richang Hong Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| ShallowJail: Steering Jailbreaks against Large Language Models Hanyu Pei, Shang Liu, Zeyan Liu Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (97%) | - |