Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ABoN: Adaptive Best-of-N Alignment Hilal Asi, Satyen Kale, Vinod Raman Published: 2025-05-17Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-05-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 4 |
| Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Jiahao Wu, Ke Tang, Ning Lu, Qi Wang Published: 2025-05-17Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |
| SafeVid: Toward Safety Aligned Video Large Multimodal Models Jiaxin Song, Xingjun Ma, Xin Wang, Yang Yao Published: 2025-05-17Area: Multimodal SafetyCitations: 4 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-17 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R4 (95%) | 4 |
| Bias Fitting to Mitigate Length Bias of Reward Model in RLHF Dongyun Xue, Houqiang Li, Jianfeng Cai, Jinhua Zhu Published: 2025-05-19Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-05-19 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 2 |
| Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization Dongha Lee, Dongjin Kang, Hyungjoo Chae, Jinyoung Yeo Published: 2025-05-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-19 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| Safety Alignment Can Be Not Superficial With Explicit Safety Signals Jianwei Li, Jung-Eun Kim Published: 2025-05-19Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 3 |
| Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning Haoran Li, Heli Xu, Huihao Jing, Peizhao Hu Published: 2025-05-20Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-05-20 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (96%) | 3 |
| "Haet Bhasha aur Diskrimineshun": Phonetic Perturbations in Code-Mixed Hinglish to Red-Team LLMs Darpan Aswal, Siddharth D Jaiswal Published: 2025-05-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment Albert No, Minsuk Kahng, Sangyeon Yoon, Wonje Jeung Published: 2025-05-20Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2025-05-20 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 10 |
| Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study Kaustubh Ponkshe, Praneeth Vepakomma, Raghav Singhal, Shaan Shah Published: 2025-05-20Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-05-20 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 1 |
| The Hallucination Tax of Reinforcement Finetuning Jieyu Zhao, Linxin Song, Taiwei Shi Published: 2025-05-20Area: Alignment TrainingCitations: 21 Tags: ai-safety, alignment-training, empirical | 2025-05-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 21 |
| Advancing LLM Safe Alignment with Safety Representation Ranking Chenheng Zhang, Quan Chen, Tianqi Du, Yisen Wang Published: 2025-05-21Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 8 |
| How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study Fei Mi, Hongning Wang, Junxiao Yang, Lifeng Shang Published: 2025-05-21Area: Alignment TrainingCitations: 16 Tags: ai-safety, alignment-training, empirical | 2025-05-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 16 |
| CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning Baolei Zhang, Biao Yi, Lihai Nie, Li Shen Published: 2025-05-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 8 |
| Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models Dongsheng Shi, Gerard de Melo, Linlin Wang, Xiaoling Wang Published: 2025-05-22Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R2 (95%) | 1 |
| Mitigating Fine-tuning Risks in LLMs via Safety-Aware Probing Optimization Chengcan Wu, Meng Sun, Yihao Zhang, Zeming Wei Published: 2025-05-22Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2025-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 10 |
| MPO: Multilingual Safety Alignment via Reward Gap Optimization An Zhang, Bing Qin, Jiahe Guo, Tat-Seng Chua Published: 2025-05-22Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, empirical | 2025-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (97%) | 8 |
| MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming Daojing He, Jing Li, Jun Yu, Min Zhang Published: 2025-05-22Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E4 / R3 (94%) | 18 |
| Refusal Direction is Universal Across Safety-Aligned Languages Barbara Plank, Hinrich Sch眉tze, Mingyang Wang, Xinpeng Wang Published: 2025-05-22Area: Representation AnalysisCitations: 5 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-05-22 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (94%) | 5 |
| Shape it Up! Restoring LLM Safety during Finetuning Duen Horng Chau, Jianfeng Chi, Pin-Yu Chen, Seongmin Lee Published: 2025-05-22Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Towards medical AI misalignment: a preliminary study Allan Tucker, Barbara Puccio, Federico Castagna, Pierangelo Veltri Published: 2025-05-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Reward Model Overoptimisation in Iterated RLHF Lorenz Wolf, Mirco Musolesi, Robert Kirk Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Scalable Valuation of Human Feedback through Provably Robust Model Alignment Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne Published: 2025-05-23Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-05-23 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? Bo Han, Chaowei Xiao, Hongzheng Yang, Kun Zhang Published: 2025-05-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | - |
| Mitigating Deceptive Alignment via Self-Monitoring Boyuan Chen, Donghai Hong, Jiaming Ji, Jiayi Zhou Published: 2025-05-24Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-05-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 14 |
| Safety Alignment via Constrained Knowledge Unlearning Daojing He, Fangming Liu, Jing Li, Jun Yu Published: 2025-05-24Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 6 |
| Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Baihui Zheng, Boren Zheng, Bo Zheng, Jiaheng Liu Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (97%) | 5 |
| Learning a Pessimistic Reward Model in RLHF Gagandeep Singh, Hangoo Kang, Tarun Suresh, Yinglun Xu Published: 2025-05-26Area: Alignment TrainingCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Lifelong Safety Alignment for Language Models Chao Du, Haoyu Wang, Min Lin, Tianyu Pang Published: 2025-05-26Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (94%) | 7 |
| SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety Byoungjip Kim, Geon-Hyeong Kim, Honglak Lee, Kyunghoon Bae Published: 2025-05-26Area: Alignment TrainingCitations: 19 Tags: ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 19 |