Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SafeLawBench: Towards Safe Alignment of Large Language Models Chuxue Cao, Han Zhu, Jiaming Ji, Juntao Dai Published: 2025-06-07Area: Safety EvaluationCitations: 7 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-06-07 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Preference Learning for AI Alignment: a Causal Perspective Katarzyna Kobalczyk, Mihaela van der Schaar Published: 2025-06-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, theoretical | 2025-06-06 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 2 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets Lei Hsiung, Linyue Song, Pin-Yu Chen, Tianyu Pang Published: 2025-06-05Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents Akshat Naik, Edward James Young, Emma Goun茅, Francisco Javier Campos Zabala Published: 2025-06-04Area: Agent SafetyCitations: 12 Tags: agent-safety, ai-safety, alignment-training, benchmark | 2025-06-04 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E5 / R3 (94%) | 12 |
| Watermarking Degrades Alignment in Language Models: Analysis and Mitigation Apurv Verma, NhatHai Phan, Shubhendu Trivedi Published: 2025-06-04Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 2 |
| IF-GUIDE: Influence Function-Guided Detoxification of LLMs Juhan Bae, Nicholas Carlini, Sanghyun Hong, Zachary Coalson Published: 2025-06-02Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 1 |
| SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla Published: 2025-05-31Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-31 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| Adversarial Preference Learning for Robust LLM Alignment Bo Tang, Chaochao Lu, Chao Yang, Chen Chen Published: 2025-05-30Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| COSMIC: Generalized Refusal Direction Identification in LLM Activations Chenguang Wang, Dawn Song, Nicholas Crispino, Sam Pan Published: 2025-05-30Area: Representation AnalysisCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-05-30 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 5 |
| Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment Charles Maalouf, Joseph Y Cheng, Kundan Krishna, Leon A Gatys Published: 2025-05-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 2 |
| AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models Jinchuan Zhang, Lu Yin, Songlin Hu, Yan Zhou Published: 2025-05-29Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-05-29 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 4 |
| Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences? Kunhe Yang, Nika Haghtalab, Paul G枚lz Published: 2025-05-29Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 11 |
| MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment John T. Halloran Published: 2025-05-29Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-05-29 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 2 |
| Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment Bo Li, Chao Du, Sensen Gao, Simeng Qin Published: 2025-05-27Area: Multimodal SafetyCitations: 20 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 20 |
| Multi-objective Large Language Model Alignment with Hierarchical Experts Deheng Ye, Fangming Liu, Guodong Du, Jing Li Published: 2025-05-27Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 3 |
| SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge Bhaskar Ramasubramanian, Bo Li, Fengbo Ma, Fengqing Jiang Published: 2025-05-27Area: Safety EvaluationCitations: 8 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (96%) | 8 |
| Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation Anil Ramakrishna, Aram Galstyan, Charith Peris, Kai-Wei Chang Published: 2025-05-27Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-27 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Baihui Zheng, Boren Zheng, Bo Zheng, Jiaheng Liu Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (97%) | 5 |
| Learning a Pessimistic Reward Model in RLHF Gagandeep Singh, Hangoo Kang, Tarun Suresh, Yinglun Xu Published: 2025-05-26Area: Alignment TrainingCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Lifelong Safety Alignment for Language Models Chao Du, Haoyu Wang, Min Lin, Tianyu Pang Published: 2025-05-26Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (94%) | 7 |
| SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety Byoungjip Kim, Geon-Hyeong Kim, Honglak Lee, Kyunghoon Bae Published: 2025-05-26Area: Alignment TrainingCitations: 19 Tags: ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 19 |
| SCAR: Shapley Credit Assignment for More Efficient RLHF Doina Precup, Meng Cao, Shuyuan Zhang, Xiao-Wen Chang Published: 2025-05-26Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 7 |
| Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? Bo Han, Chaowei Xiao, Hongzheng Yang, Kun Zhang Published: 2025-05-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | - |
| Mitigating Deceptive Alignment via Self-Monitoring Boyuan Chen, Donghai Hong, Jiaming Ji, Jiayi Zhou Published: 2025-05-24Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-05-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 14 |
| Safety Alignment via Constrained Knowledge Unlearning Daojing He, Fangming Liu, Jing Li, Jun Yu Published: 2025-05-24Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 6 |
| Reward Model Overoptimisation in Iterated RLHF Lorenz Wolf, Mirco Musolesi, Robert Kirk Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Scalable Valuation of Human Feedback through Provably Robust Model Alignment Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning Baolei Zhang, Biao Yi, Lihai Nie, Li Shen Published: 2025-05-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 8 |
| Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models Dongsheng Shi, Gerard de Melo, Linlin Wang, Xiaoling Wang Published: 2025-05-22Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R2 (95%) | 1 |