Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Super Co-alignment of Human and AI for Sustainable Symbiotic Society Bing Han, Boyuan Chen, Chao Liu, Dongcheng Zhao Published: 2025-04-24Area: Scalable OversightCitations: 3 Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-04-24 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E5 / R3 (94%) | 3 |
| Safety Pretraining: Toward the Next Generation of Safe AI Alex Robey, Andy Zou, Dylan Sam, J. Zico Kolter Published: 2025-04-23Area: Alignment TrainingCitations: 24 Tags: ai-safety, alignment-training, empirical | 2025-04-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 24 |
| Learning Explainable Dense Reward Shapes via Bayesian Optimization Dongyeop Kang, Ian Yang, Kwang-Sung Jun, Mingyi Hong Published: 2025-04-22Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-04-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization Chun Chen, Churui Zeng, Kedong Xiu, Kui Ren Published: 2025-04-21Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R5 (96%) | 5 |
| Establishing Reliability Metrics for Reward Models in Large Language Models Anxiang Zeng, Guangda Huzhang, Han Yu, Qingtao Yu Published: 2025-04-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-04-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1 |
| Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? Andrew Zhao, Gao Huang, Rui Lu, Shiji Song Published: 2025-04-18Area: Alignment TrainingCitations: 559 Tags: ai-safety, alignment-training, empirical | 2025-04-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 559 |
| VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization Jingjing Dong, Menglan Chen, Siheng Chen, WenHao Wang Published: 2025-04-17Area: Multimodal SafetyCitations: 6 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-17 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Reward Consistency: Improving Multi-Objective Alignment from a Data-Centric Perspective Jun Zhou, Xin Zhang, Xiting Wang, Yongqi Tong Published: 2025-04-15Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-04-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? Jian Liang, Jiyang Guan, Ran He, Yanbo Wang Published: 2025-04-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (93%) | 7 |
| Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data Linchao Zhu, Shuai Zhao, Yi Yang Published: 2025-04-14Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-04-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 5 |
| RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability Dongbai Li, Yao Huang, Yichi Zhang, Yinpeng Dong Published: 2025-04-14Area: Alignment TrainingCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-14 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 46 |
| Alleviating the Fear of Losing Alignment in LLM Fine-tuning Guanhong Tao, Jun Xu, Kang Yang, Xun Chen Published: 2025-04-13Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-04-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 14 |
| SaRO: Enhancing LLM Safety through Reasoning-based Alignment Shikun Zhang, Wei Ye, Yutao Mou, Yuxiao Luo Published: 2025-04-13Area: Alignment TrainingCitations: 16 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-13 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (98%) | 16 |
| Bridging the Gap Between Preference Alignment and Machine Unlearning Chaochao Chen, Huwei Ji, Jiaming Zhang, Li Zhang Published: 2025-04-09Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-04-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models An Zhang, Junfeng Fang, Kun Wang, Ruipeng Wang Published: 2025-04-09Area: Multimodal SafetyCitations: 34 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 34 |
| Adversarial Training of Reward Models Adithya Renduchintala, Alexander Bukharin, Haifeng Qian, Oleksii Kuchaiev Published: 2025-04-08Area: Alignment TrainingCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| A Domain-Based Taxonomy of Jailbreak Vulnerabilities in Large Language Models Andr茅s Herrera-Poyatos, Carlos Pel谩ez-Gonz谩lez, Cristina Zuheros, David Herrera-Poyatos Published: 2025-04-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, survey | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, survey | E6 / R4 (96%) | 1 |
| Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents Chen Wang, Jaymari Chua, Lina Yao Published: 2025-04-04Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-04-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Sample, Don't Search: Rethinking Test-Time Alignment for Language Models Gon莽alo Faria, Noah A. Smith Published: 2025-04-04Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-04-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 14 |
| More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment Ananth Grama, Bolian Li, David Cho, Junyuan Hong Published: 2025-04-03Area: Alignment TrainingCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-03 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 5 |
| The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context Manasa Bharadwaj, Nikhil Verma Published: 2025-04-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-04-03 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (96%) | 4 |
| An Approach to Technical AGI Safety and Security Alexander Matt Turner, Alex Irpan, Allan Dafoe, Anca Dragan Published: 2025-04-02Area: Surveys & ReviewsCitations: 35 Tags: ai-safety, alignment-training, position, surveys-reviews | 2025-04-02 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E5 / R3 (96%) | 35 |
| STAR-1: Safer Alignment of Reasoning LLMs with 1K Data Bhavya Kailkhura, Brian R. Bartoldson, Cihang Xie, Haoqin Tu Published: 2025-04-02Area: Alignment TrainingCitations: 41 Tags: ai-safety, alignment-training, dataset | 2025-04-02 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 41 |
| Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots Erfan Shayegani, G M Shahariar, Lei Yu, Nael Abu-Ghazaleh Published: 2025-04-01Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-01 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models Eric Hanchen Jiang, Jingxuan Fan, Mingye Gao, Xiaomin Li Published: 2025-03-26Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-03-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 5 |
| Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization Gang Pan, Juntao Dai, Qian Zheng, Taiye Chen Published: 2025-03-23Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-03-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Safe RLHF-V: Safe Reinforcement Learning from Human Feedback in Multimodal Large Language Models Boyuan Chen, Chi-Min Chan, Conghui Zhang, Donghai Hong Published: 2025-03-22Area: Alignment TrainingCitations: 9 Tags: ai-safety, alignment-training, empirical | 2025-03-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 9 |
| SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging Aladin Djuhera, Farhan Ahmed, Holger Boche, Swanand Ravindra Kadhe Published: 2025-03-21Area: Alignment TrainingCitations: 21 Tags: ai-safety, alignment-training, empirical | 2025-03-21 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | 21 |
| Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling Kehai Chen, Liqiang Nie, Min Zhang, Qiyuan Deng Published: 2025-03-13Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-03-13 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 2 |
| Mitigating Preference Hacking in Policy Optimization with Pessimism Adam Fisch, Alekh Agarwal, Christoph Dann, Dhawal Gupta Published: 2025-03-10Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, theoretical | 2025-03-10 | Alignment Training | ai-safety, alignment-training, theoretical | E6 / R3 (95%) | 3 |