Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Robust Policy Optimization to Prevent Catastrophic Forgetting Adel Javanmard, George Pappas, Hamed Hassani, Mahdi Sabbaghi Published: 2026-02-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Stress-Testing Alignment Audits With Prompt-Level Strategic Deception Ben Marlin, David Lindner, Oliver Daniels, Perusha Moodley Published: 2026-02-09Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-02-09 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment Junhao Dong, Kun Wang, Kun Yang, Qiankun Li Published: 2026-02-10Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-10 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies Chaozhuo Li, Chenxu Wang, Jinyu Hou, Ji Qi Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E4 / R3 (95%) | - |
| Trustworthy Agentic AI Requires Deterministic Architectural Boundaries Manish Bhattarai, Minh Vu Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, theoretical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | - |
| Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling Bo Chen, Dandan Guo, Guowei Rong, Mingyuan Zhou Published: 2026-02-11Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Capability-Oriented Training Induced Alignment Risk Han Bao, Kehan Guo, Nitesh V Chawla, Nuno Moniz Published: 2026-02-12Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-12 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (94%) | 1 |
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Unifying Stable Optimization and Reference Regularization in RLHF Dadong Wang, He Zhao, Li He, Lina Yao Published: 2026-02-12Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2026-02-12 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks Chong Xiang, Neil Zhenqiang Gong, Ruiqi Wang, Xilong Wang Published: 2026-02-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment Elias Malomgr茅, Pieter Simoens Published: 2026-02-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (97%) | - |
| Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation Hiroki Fukui Published: 2026-02-17Area: cs.CYCitations: 15 Tags: ai-safety, alignment-training, cscy, preprint, safety-evaluation | 2026-02-17 | cs.CY | ai-safety, alignment-training, cscy, preprint, safety-evaluation | E12 / R7 (92%) | 15 |
| GMAIL: Generative Modality Alignment for generated Image Learning Shentong Mo, Sukmin Yun Published: 2026-02-17Area: cs.CVCitations: 45 Tags: ai-safety, alignment-training, cscv, preprint | 2026-02-17 | cs.CV | ai-safety, alignment-training, cscv, preprint | E8 / R6 (92%) | 45 |
| Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment David Lagnado, Maria Victoria Carro Published: 2026-02-17Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-02-17 | cs.AI | ai-safety, alignment-training, csai, preprint | E9 / R7 (92%) | - |
| Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment Alireza Hashemi, Asad A. Butt, Heinrich Peters, James Rae Published: 2026-02-17Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E9 / R8 (93%) | - |
| Relative Geometry of Neural Forecasters: Linking Accuracy and Alignment in Learned Latent Geometry Christian Deubel, Deniz Kucukahmetler, Diaaeldin Taha, Julian Mosig von Aehrenfeld Published: 2026-02-17Area: cs.LGCitations: 15 Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E10 / R8 (90%) | 15 |
| The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety Aleksandra Korolova, Blossom Metevier, Bohdan Turbal, Chung Peng Lee Published: 2026-02-17Area: cs.LGCitations: 65 Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-17 | cs.LG | ai-safety, alignment-training, cslg, preprint | E8 / R8 (95%) | 65 |
| Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment Juntao Dai, Xiaohao Liu, Yaodong Yang, Yuyan Bu Published: 2026-02-18Area: cs.CLCitations: 1 Tags: ai-safety, alignment-training, cscl, preprint | 2026-02-18 | cs.CL | ai-safety, alignment-training, cscl, preprint | E10 / R7 (92%) | 1 |
| Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment Eva Paraschou, Line Harder Clemmensen, Sneha Das Published: 2026-02-18Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-18 | cs.LG | ai-safety, alignment-training, cslg, preprint | E11 / R10 (95%) | - |
| Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents Idhant Gulati, Shivam Raval Published: 2026-02-18Area: cs.AICitations: 15 Tags: ai-safety, alignment-training, csai, preprint | 2026-02-18 | cs.AI | ai-safety, alignment-training, csai, preprint | E8 / R6 (92%) | 15 |
| References Improve LLM Alignment in Non-Verifiable Domains Alexander R. Fabbri, Arman Cohan, Kejian Shi, Peifeng Wang Published: 2026-02-18Area: cs.CLCitations: 15 Tags: ai-safety, alignment-training, cscl, preprint | 2026-02-18 | cs.CL | ai-safety, alignment-training, cscl, preprint | E17 / R8 (92%) | 15 |
| Federated Latent Space Alignment for Multi-user Semantic Communications Emilio Calvanese Strinati, Giuseppe Di Poce, Mario Edoardo Pandolfo, Paolo Di Lorenzo Published: 2026-02-19Area: cs.ITCitations: - Tags: ai-safety, alignment-training, csit, preprint | 2026-02-19 | cs.IT | ai-safety, alignment-training, csit, preprint | E11 / R8 (96%) | - |
| FLoRG: Federated Fine-tuning with Low-rank Gram Matrices and Procrustes Alignment Chuiyang Meng, Ming Tang, Vincent W. S. Wong Published: 2026-02-19Area: cs.LGCitations: 15 Tags: ai-safety, alignment-training, cslg, preprint | 2026-02-19 | cs.LG | ai-safety, alignment-training, cslg, preprint | E11 / R11 (91%) | 15 |
| ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment Haosen Sun, Hongjue Zhao, Huajie Shao, Jiangtao Kong Published: 2026-02-19Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-02-19 | cs.AI | ai-safety, alignment-training, csai, preprint | E10 / R8 (92%) | - |
| Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems Dominic DiFranzo, Hanjing Shi Published: 2026-02-20Area: cs.AICitations: 15 Tags: ai-safety, alignment-training, csai, preprint | 2026-02-20 | cs.AI | ai-safety, alignment-training, csai, preprint | E8 / R6 (89%) | 15 |
| Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications Ryan Diaz, Sangwon Seo, Vaibhav Unhelkar, Zhiqin Qian Published: 2026-02-20Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-02-20 | cs.AI | ai-safety, alignment-training, csai, preprint | E9 / R7 (93%) | - |
| ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models Ang Li, Chenxiang Luo, Guoheng Sun, Kaixi Feng Published: 2026-02-20Area: cs.CVCitations: - Tags: ai-safety, alignment-training, cscv, preprint | 2026-02-20 | cs.CV | ai-safety, alignment-training, cscv, preprint | E9 / R6 (91%) | - |
| MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment Advait Swaminathan, Kevin Zhu, Nguyen Dao Minh Anh, Sagarika Banerjee Published: 2026-02-21Area: cs.CVCitations: 45 Tags: ai-safety, alignment-training, cscv, preprint, safety-evaluation | 2026-02-21 | cs.CV | ai-safety, alignment-training, cscv, preprint, safety-evaluation | E15 / R9 (90%) | 45 |
| Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code Binhang Yuan, Bohan Zeng, Chen Chen, Haobo Lin Published: 2026-02-21Area: cs.CVCitations: - Tags: ai-safety, alignment-training, cscv, preprint | 2026-02-21 | cs.CV | ai-safety, alignment-training, cscv, preprint | E5 / R5 (91%) | - |