Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction Duohe Ma, Tianyun Liu, Tingwen Liu, Yingjie Zhang Published: 2025-09-18Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features Clement Neo, Ilija Lichkovski, Jeremias Ferrao, Matthijs van der Lende Published: 2025-09-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-09-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | - |
| NeuroStrike: Neuron-Level Attacks on Aligned LLMs Ahmad-Reza Sadeghi, Lichao Wu, Maximilian Thang, Mohamadreza Rostami Published: 2025-09-15Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check Bo Han, Chentao Cao, Hang Li, Xiaojun Xu Published: 2025-09-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment Meiyin Meng, Zaixi Zhang Published: 2025-09-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R5 (98%) | - |
| Too Helpful, Too Harmless, Too Honest or Just Right? Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-10Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-09-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (96%) | 5 |
| Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint Bing Qin, Fenglei Fan, Jiawei Cao, Kai He Published: 2025-09-08Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-09-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 4 |
| Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Guangdong Bai, Shuai Yuan, Wang Kailong, Yuxi Li Published: 2025-09-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy Published: 2025-09-07Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-09-07 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain Amin Bigdeli, Amira Ghenai, Charles L. A. Clarke, Shakiba Amirshahi Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention Chenhan Yuan, Fei Huang, Junyang Lin, Tsung-Yi Ho Published: 2025-09-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | 3 |
| When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment Hainiu Xu, Hanqi Yan, Shu Yang, Siya Qi Published: 2025-08-30Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh Published: 2025-08-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection Bernard Ghanem, George Turkiyyah, Harethah Abu Shairah, Hasan Abed Al Kader Hammoud Published: 2025-08-28Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 3 |
| Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment Julian Arnold, Niels L枚rch Published: 2025-08-27Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Ensemble Debates with Local Large Language Models for AI Alignment Ephraiem Sarabamoun Published: 2025-08-27Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-08-27 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E10 / R10 (94%) | - |
| Safety Alignment Should Be Made More Than Just A Few Attention Heads Chao Huang, Chuang Zhang, Juwei Yue, Quangang Li Published: 2025-08-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality Chaowei Xiao, Nanxi Li, Zhengyue Zhao Published: 2025-08-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-26 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (97%) | - |
| Weights-Rotated Preference Optimization for Large Language Models Chenxu Yang, Hua Wu, Mingyu Zheng, Naibin Gu Published: 2025-08-25Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (97%) | 1 |
| School of Reward Hacks: Hacking Harmless Tasks Generalizes to Misaligned Behavior in LLMs James Chua, Jan Betley, Johannes Treutlein, Mia Taylor Published: 2025-08-24Area: Deception & FailureCitations: 17 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 17 |
| Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation Chang Liu, Hang Su, Huanran Chen, Jun Zhu Published: 2025-08-21Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2025-08-21 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 1 |
| Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation Dongyoon Hahm, Kimin Lee, Taywon Min, Woogyeol Jin Published: 2025-08-19Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models Haoyang Chen, Jianhao Chen, Jianjie Huang, Mayi Xu Published: 2025-08-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Rethinking Safety in LLM Fine-tuning: An Optimization Perspective Adel Bibi, Bernard Ghanem, David Krueger, Fazl Barez Published: 2025-08-17Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 5 |
| Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position Jun Luo, Xurui Song, Zhixin Xie Published: 2025-08-17Area: Alignment TrainingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 6 |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs Birong Pan, Jianhao Chen, Mayi Xu, Ming Zhong Published: 2025-08-13Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 1 |
| Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training Jianfeng Si, Lin Sun, Xiangzheng Zhang, Zhewen Tan Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 6 |
| From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training Alec Helyar, Alex Beutel, Andrea Vallone, Anna-Luisa Brakman Published: 2025-08-12Area: Alignment TrainingCitations: 23 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 23 |