Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models Stephen H. Bach, Yik Siu Chan, Zheng-Xin Yong Published: 2025-07-16Area: Safety EvaluationCitations: 9 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-07-16 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 9 |
| AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning An Zhang, Leheng Sheng, Xiang Wang, XiuYu Zhang Published: 2025-07-20Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-07-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 5 |
| Subliminal Learning: Language models transmit behavioral traits via hidden signals in data Alex Cloud, Anna Sztyber-Betley, Jacob Hilton, James Chua Published: 2025-07-20Area: Deception & FailureCitations: 35 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R4 (96%) | 35 |
| LoRA is All You Need for Safety Alignment of Reasoning LLMs Baharan Mirzasoleiman, Yihao Xue Published: 2025-07-22Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization Dongyao Zhu, Han Jiang, Xiaoyuan Yi, Xing Xie Published: 2025-07-22Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning Adam Karvonen, Caden Juang, Helena Casademunt, Neel Nanda Published: 2025-07-22Area: Model EditingCitations: 13 Tags: ai-safety, alignment-training, empirical, interpretability, model-editing | 2025-07-22 | Model Editing | ai-safety, alignment-training, empirical, interpretability, model-editing | E6 / R3 (93%) | 13 |
| Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment Hao Li, Jing Shao, Lei Sha, Lijun Li Published: 2025-07-24Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2025-07-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 15 |
| The Blessing and Curse of Dimensionality in Safety Alignment Laziz U. Abdullaev, Rachel S.Y. Teo, Tan M. Nguyen Published: 2025-07-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models Xingcheng Xu Published: 2025-07-27Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-27 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R4 (96%) | 4 |
| UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases Preslav Nakov, Raj Vardhan Tomar, Yuxia Wang Published: 2025-07-29Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, dataset | 2025-07-29 | Alignment Training | ai-safety, alignment-training, dataset | E7 / R4 (95%) | 4 |
| Large Reasoning Models Are Autonomous Jailbreak Agents Erik Derner, Nuria Oliver, Thilo Hagendorff Published: 2025-08-04Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 3 |
| TRACEALIGN - Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs Aman Chadha, Amitava Das, Amit Sheth, S M Mehedi Zaman Published: 2025-08-04Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R5 (98%) | - |
| P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis Bofei Gao, Feifan Song, Guoyin Wang, Houfeng Wang Published: 2025-08-06Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 1 |
| Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining Bing Han, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 1 |
| Towards Integrated Alignment Ben Y. Reis, William La Cava Published: 2025-08-08Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2025-08-08 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (93%) | - |
| SafeGrad: Gradient Surgery for Safe LLM Fine-Tuning Baolei Zhang, Biao Yi, Jiahao Li, Lihai Nie Published: 2025-08-10Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (95%) | 6 |
| Jinx: Unlimited LLMs for Probing Alignment Failures Jiahao Zhao, Liwei Dong Published: 2025-08-11Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, safety-evaluation, tool | 2025-08-11 | Safety Evaluation | ai-safety, alignment-training, safety-evaluation, tool | E6 / R4 (96%) | - |
| Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity Bernhard Kainz, Jingyuan Zhang, Mengyun Qiao, Shuyuan Zhang Published: 2025-08-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training Jianfeng Si, Lin Sun, Xiangzheng Zhang, Zhewen Tan Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 6 |
| From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training Alec Helyar, Alex Beutel, Andrea Vallone, Anna-Luisa Brakman Published: 2025-08-12Area: Alignment TrainingCitations: 23 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 23 |
| Interpretable Reward Model via Sparse Autoencoder Hengxing Cai, Jiayi Liao, Shuyi Zhang, Sihang Li Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 6 |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs Birong Pan, Jianhao Chen, Mayi Xu, Ming Zhong Published: 2025-08-13Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 1 |
| Rethinking Safety in LLM Fine-tuning: An Optimization Perspective Adel Bibi, Bernard Ghanem, David Krueger, Fazl Barez Published: 2025-08-17Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 5 |
| Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position Jun Luo, Xurui Song, Zhixin Xie Published: 2025-08-17Area: Alignment TrainingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 6 |
| RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models Haoyang Chen, Jianhao Chen, Jianjie Huang, Mayi Xu Published: 2025-08-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation Dongyoon Hahm, Kimin Lee, Taywon Min, Woogyeol Jin Published: 2025-08-19Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation Chang Liu, Hang Su, Huanran Chen, Jun Zhu Published: 2025-08-21Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2025-08-21 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 1 |
| School of Reward Hacks: Hacking Harmless Tasks Generalizes to Misaligned Behavior in LLMs James Chua, Jan Betley, Johannes Treutlein, Mia Taylor Published: 2025-08-24Area: Deception & FailureCitations: 17 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 17 |
| Weights-Rotated Preference Optimization for Large Language Models Chenxu Yang, Hua Wu, Mingyu Zheng, Naibin Gu Published: 2025-08-25Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (97%) | 1 |