Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality Chaowei Xiao, Nanxi Li, Zhengyue Zhao Published: 2025-08-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-26 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (97%) | - |
| Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment Julian Arnold, Niels L枚rch Published: 2025-08-27Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Ensemble Debates with Local Large Language Models for AI Alignment Ephraiem Sarabamoun Published: 2025-08-27Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-08-27 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E10 / R10 (94%) | - |
| Safety Alignment Should Be Made More Than Just A Few Attention Heads Chao Huang, Chuang Zhang, Juwei Yue, Quangang Li Published: 2025-08-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh Published: 2025-08-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection Bernard Ghanem, George Turkiyyah, Harethah Abu Shairah, Hasan Abed Al Kader Hammoud Published: 2025-08-28Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 3 |
| When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment Hainiu Xu, Hanqi Yan, Shu Yang, Siya Qi Published: 2025-08-30Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention Chenhan Yuan, Fei Huang, Junyang Lin, Tsung-Yi Ho Published: 2025-09-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | 3 |
| Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain Amin Bigdeli, Amira Ghenai, Charles L. A. Clarke, Shakiba Amirshahi Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy Published: 2025-09-07Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-09-07 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint Bing Qin, Fenglei Fan, Jiawei Cao, Kai He Published: 2025-09-08Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-09-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 4 |
| Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Guangdong Bai, Shuai Yuan, Wang Kailong, Yuxi Li Published: 2025-09-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Too Helpful, Too Harmless, Too Honest or Just Right? Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-10Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-09-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (96%) | 5 |
| A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment Meiyin Meng, Zaixi Zhang Published: 2025-09-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R5 (98%) | - |
| NeuroStrike: Neuron-Level Attacks on Aligned LLMs Ahmad-Reza Sadeghi, Lichao Wu, Maximilian Thang, Mohamadreza Rostami Published: 2025-09-15Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check Bo Han, Chentao Cao, Hang Li, Xiaojun Xu Published: 2025-09-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features Clement Neo, Ilija Lichkovski, Jeremias Ferrao, Matthijs van der Lende Published: 2025-09-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-09-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | - |
| Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction Duohe Ma, Tianyun Liu, Tingwen Liu, Yingjie Zhang Published: 2025-09-18Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots Amir M. Rahmani, Chenhan Lyu, Pengfei Zhang, Yutong Song Published: 2025-09-19Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-09-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Stress Testing Deliberative Alignment for Anti-Scheming Training Alexander Meinke, Alex Lloyd, Amelia Glaese, Andrei Matveiakin Published: 2025-09-19Area: Deception & FailureCitations: 26 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (94%) | 26 |
| LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization Bihao Zhan, Jie Zhou, Junsong Li, Liang He Published: 2025-09-21Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Who is In Charge? Dissecting Role Conflicts in Instruction Following Siqi Zeng Published: 2025-09-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-09-23 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R4 (92%) | - |
| Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training Bing Liu, Jaehwan Jeong, Junkai Zhang, Lifeng Jin Published: 2025-09-25Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, empirical | 2025-09-25 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 11 |
| Preemptive Detection and Steering of LLM Misalignment via Latent Reachability Sathwik Karnik, Somil Bansal Published: 2025-09-25Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language Isa Inuwa-Dutse Published: 2025-09-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-09-26 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| The Rogue Scalpel: Activation Steering Compromises LLM Safety Alexey Dontsov, Andrey Galichin, Anton Korznikov, Elena Tutubalina Published: 2025-09-26Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 4 |
| We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-26Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-26 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 2 |
| A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models Albert No, Dongjae Jeon, Hyesoo Hong, Sangwoo Shin Published: 2025-09-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |