Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SCAR: Shapley Credit Assignment for More Efficient RLHF Doina Precup, Meng Cao, Shuyuan Zhang, Xiao-Wen Chang Published: 2025-05-26Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 7 |
| Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment Bo Li, Chao Du, Sensen Gao, Simeng Qin Published: 2025-05-27Area: Multimodal SafetyCitations: 20 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 20 |
| Multi-objective Large Language Model Alignment with Hierarchical Experts Deheng Ye, Fangming Liu, Guodong Du, Jing Li Published: 2025-05-27Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 3 |
| SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge Bhaskar Ramasubramanian, Bo Li, Fengbo Ma, Fengqing Jiang Published: 2025-05-27Area: Safety EvaluationCitations: 8 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (96%) | 8 |
| Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation Anil Ramakrishna, Aram Galstyan, Charith Peris, Kai-Wei Chang Published: 2025-05-27Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-27 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models Jinchuan Zhang, Lu Yin, Songlin Hu, Yan Zhou Published: 2025-05-29Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-05-29 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 4 |
| Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences? Kunhe Yang, Nika Haghtalab, Paul G枚lz Published: 2025-05-29Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 11 |
| MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment John T. Halloran Published: 2025-05-29Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-05-29 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 2 |
| Adversarial Preference Learning for Robust LLM Alignment Bo Tang, Chaochao Lu, Chao Yang, Chen Chen Published: 2025-05-30Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| COSMIC: Generalized Refusal Direction Identification in LLM Activations Chenguang Wang, Dawn Song, Nicholas Crispino, Sam Pan Published: 2025-05-30Area: Representation AnalysisCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-05-30 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 5 |
| Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment Charles Maalouf, Joseph Y Cheng, Kundan Krishna, Leon A Gatys Published: 2025-05-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 2 |
| SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla Published: 2025-05-31Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-31 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| IF-GUIDE: Influence Function-Guided Detoxification of LLMs Juhan Bae, Nicholas Carlini, Sanghyun Hong, Zachary Coalson Published: 2025-06-02Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 1 |
| AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents Akshat Naik, Edward James Young, Emma Goun茅, Francisco Javier Campos Zabala Published: 2025-06-04Area: Agent SafetyCitations: 12 Tags: agent-safety, ai-safety, alignment-training, benchmark | 2025-06-04 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E5 / R3 (94%) | 12 |
| Watermarking Degrades Alignment in Language Models: Analysis and Mitigation Apurv Verma, NhatHai Phan, Shubhendu Trivedi Published: 2025-06-04Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 2 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets Lei Hsiung, Linyue Song, Pin-Yu Chen, Tianyu Pang Published: 2025-06-05Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| Preference Learning for AI Alignment: a Causal Perspective Katarzyna Kobalczyk, Mihaela van der Schaar Published: 2025-06-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-06 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 2 |
| From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment Hyunbin Jin, Kyubyung Chae, Taesup Kim Published: 2025-06-07Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| SafeLawBench: Towards Safe Alignment of Large Language Models Chuxue Cao, Han Zhu, Jiaming Ji, Juntao Dai Published: 2025-06-07Area: Safety EvaluationCitations: 7 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-06-07 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values Ahmed Amer, Evan Harris, Nell Watson, Preeti Ravindra Published: 2025-06-08Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-06-08 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1 |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures Sibei Yang, Wenjie Wang, Yukai Zhou Published: 2025-06-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | 2 |
| Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Liwei Jiang, Mickel Liu, Natasha Jaques, Simon Shaolei Du Published: 2025-06-09Area: Alignment TrainingCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (98%) | 18 |
| QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA Aswin RRV, Ben Zhou, Chitta Baral, Jacob Dineen Published: 2025-06-09Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (96%) | 10 |
| Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints Austin Hoag, Blossom Metevier, Philip S. Thomas, Scott Niekum Published: 2025-06-09Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks Changick Kim, Seokil Ham, Seungju Cho, Younghun Kim Published: 2025-06-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts Alexandra Dmitrienko, Hamid Dashtbani, Torsten Krau脽 Published: 2025-06-09Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 12 |
| When Style Breaks Safety: Defending Language Models Against Superficial Style Alignment Marzyeh Ghassemi, Sana Tonekaboni, Vinith Suriyakumar, Walter Gerych Published: 2025-06-09Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin Hailiang Dai, Jiayu Yao, Jigang Wang, Kunpeng Ning Published: 2025-06-10Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, empirical | 2025-06-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |