Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Refusal Residue: When Probes Catch Alignment Faking and When They Don't Aman Mehta Published: 2026-07-15Area: cs.CRCitations: 1 Tags: ai-safety, alignment-training, cscr, preprint | 2026-07-15 | cs.CR | ai-safety, alignment-training, cscr, preprint | E8 / R6 (92%) | 1 |
| ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs Amrita Bhattacharjee, Aryan Keluskar, Huan Liu Published: 2026-07-15Area: cs.SECitations: - Tags: ai-safety, alignment-training, csse, preprint | 2026-07-15 | cs.SE | ai-safety, alignment-training, csse, preprint | E8 / R6 (94%) | - |
| Forgetting Our Way to Shared Meaning: Effects of Forgetting on Conceptual Alignment in a Non-Partnership Coordination Game Alan Tsang, Landon Liu, Mary Kelly Published: 2026-07-13Area: cs.MACitations: - Tags: ai-safety, alignment-training, csma, preprint | 2026-07-13 | cs.MA | ai-safety, alignment-training, csma, preprint | E10 / R6 (90%) | - |
| Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach Chengjun Zhang, Jianna Hur, Jingjing Zhang, Sagar Samtani Published: 2026-07-12Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-12 | cs.AI | ai-safety, alignment-training, csai, preprint | E5 / R6 (90%) | - |
| Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health Asher Sprigler, David Kinney, Iftach Amir, Jonathan E. Bogard Published: 2026-07-12Area: cs.AICitations: 13 Tags: ai-safety, alignment-training, csai, preprint | 2026-07-12 | cs.AI | ai-safety, alignment-training, csai, preprint | E13 / R9 (92%) | 13 |
| ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm Kefan Song, Yanjun Qi Published: 2026-07-11Area: cs.AICitations: 12 Tags: ai-safety, alignment-training, csai, preprint | 2026-07-11 | cs.AI | ai-safety, alignment-training, csai, preprint | E10 / R6 (91%) | 12 |
| Geopolitical alignment: Endorsement effects in large language models Maxim Chupilkin Published: 2026-07-10Area: cs.CYCitations: - Tags: ai-safety, alignment-training, cscy, preprint | 2026-07-10 | cs.CY | ai-safety, alignment-training, cscy, preprint | E12 / R12 (90%) | - |
| SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification Anantaa Kotal, Aritran Piplai, Ivan Alejandro Montoya Sanchez Published: 2026-07-10Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-07-10 | cs.LG | ai-safety, alignment-training, cslg, preprint | E23 / R24 (93%) | - |
| Aleena: Alignment Agent for Research Software Engineering Collaborations Anant Mittal, Anshul Tambay, Carlos Garcia Jurado Suarez, Cordero Core Published: 2026-07-09Area: cs.SECitations: - Tags: ai-safety, alignment-training, csse, preprint | 2026-07-09 | cs.SE | ai-safety, alignment-training, csse, preprint | E18 / R15 (90%) | - |
| Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment Seongjae Kang, Taehyung Yu Published: 2026-07-09Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint, safety-evaluation | 2026-07-09 | cs.CL | ai-safety, alignment-training, cscl, preprint, safety-evaluation | E9 / R6 (94%) | - |
| Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition Anissa Mokraoui, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Jing Jie Tan Published: 2026-07-09Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-09 | cs.CL | ai-safety, alignment-training, cscl, preprint | E14 / R13 (89%) | - |
| PLURAL: A Global Dataset for Value Alignment Aditya Vashistha, Anya Shukla, Dhruv Agarwal, Tanya Goyal Published: 2026-07-09Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-09 | cs.CL | ai-safety, alignment-training, cscl, preprint | E12 / R10 (92%) | - |
| Alignment Plausibility: A New Standard for Assuring AI in Healthcare Bilal A Mateen, Gwydion Williams, Sara Zannone Published: 2026-07-08Area: cs.AICitations: 62 Tags: ai-safety, alignment-training, csai, preprint | 2026-07-08 | cs.AI | ai-safety, alignment-training, csai, preprint | E8 / R9 (92%) | 62 |
| Efficient Safety Alignment of Language Models via Latent Personality Traits Adam Oberman, Damiano Fornasiere, David Williams-King, Linh Le Published: 2026-07-08Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-07-08 | cs.LG | ai-safety, alignment-training, cslg, preprint | E10 / R8 (93%) | - |
| Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning Benjamin Poole, Minwoo Lee Published: 2026-07-08Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-08 | cs.AI | ai-safety, alignment-training, csai, preprint | E11 / R10 (90%) | - |
| Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment Han-Jun Ko, Haobo Yuan, Hsin-Ying Lee, Jr-Jen Chen Published: 2026-07-07Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-07 | cs.AI | ai-safety, alignment-training, csai, preprint | E11 / R11 (95%) | - |
| Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs Albert Zeyer, Hermann Ney, Ralf Schl眉ter Published: 2026-07-07Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-07 | cs.CL | ai-safety, alignment-training, cscl, preprint | E10 / R10 (96%) | - |
| Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment Jiaxing Wang, Mingyang Yi, Xiuyu Li, Yu Li Published: 2026-07-06Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-06 | cs.CL | ai-safety, alignment-training, cscl, preprint | E12 / R10 (88%) | - |
| Covert Trait Propagation Is Representation Alignment: Mechanistic Evidence from Hidden-Channel Distillation Aditya Shah, Kargi Chauhan Published: 2026-07-05Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-07-05 | cs.LG | ai-safety, alignment-training, cslg, preprint | E8 / R7 (90%) | - |
| Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5 Lyndon Drake, Zandi Eberstadt Published: 2026-07-05Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-05 | cs.CL | ai-safety, alignment-training, cscl, preprint | E8 / R6 (95%) | - |
| KARMA: Knowledge graph-based Automated Reasoning Materialization and Alignment Chaebin Jeong, Donghyeon Park, Jinkyeong Choi Published: 2026-07-03Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint | 2026-07-03 | cs.CL | ai-safety, alignment-training, cscl, preprint | E8 / R8 (94%) | - |
| Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models Defeng Li, Hui Xue, Jialing Tao, Jiayu Shen Published: 2026-07-03Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-03 | cs.AI | ai-safety, alignment-training, csai, preprint | E8 / R8 (92%) | - |
| Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning Canran Xiao, Chengzhen Yu, Siyuan Ma, Yang Liu Published: 2026-07-03Area: cs.CVCitations: - Tags: ai-safety, alignment-training, cscv, preprint | 2026-07-03 | cs.CV | ai-safety, alignment-training, cscv, preprint | E8 / R6 (92%) | - |
| Unbiased Alignment for Large Language Models with Noisy Preferences Haoliang Li, Hui Liu, Jialiang Wang, Xianming Liu Published: 2026-07-03Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-07-03 | cs.LG | ai-safety, alignment-training, cslg, preprint | E8 / R8 (95%) | - |
| When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions Peiying Zhu, Sidi Chang Published: 2026-07-03Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-03 | cs.AI | ai-safety, alignment-training, csai, preprint | E10 / R8 (95%) | - |
| Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale Artem Sorokin, Dario Pasquini, Vadym Hadetskyi Published: 2026-07-02Area: cs.CRCitations: - Tags: ai-safety, alignment-training, cscr, preprint | 2026-07-02 | cs.CR | ai-safety, alignment-training, cscr, preprint | E10 / R10 (89%) | - |
| Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale Artem Sorokin, Dario Pasquini, Vadym Hadetskyi Published: 2026-07-02Area: cs.CRCitations: - Tags: ai-safety, alignment-training, cscr, preprint | 2026-07-02 | cs.CR | ai-safety, alignment-training, cscr, preprint | E12 / R7 (93%) | - |
| Safe Inference-Time Alignment via Lagrangian Reward Augmentation Ativ Joshi, Scott Niekum, Sohini Chintala, Yaswanth Chittepu Published: 2026-07-02Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint | 2026-07-02 | cs.LG | ai-safety, alignment-training, cslg, preprint | E9 / R8 (93%) | - |
| Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters Meng Li, Tianjian Yang Published: 2026-07-02Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint | 2026-07-02 | cs.AI | ai-safety, alignment-training, csai, preprint | E8 / R4 (96%) | - |
| VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment Fangxiang Feng, Fengfa Li, Guoyang Xia, Hongjin Ji Published: 2026-07-02Area: cs.CVCitations: - Tags: ai-safety, alignment-training, cscv, preprint | 2026-07-02 | cs.CV | ai-safety, alignment-training, cscv, preprint | E15 / R15 (91%) | - |