Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents Chen Wang, Jaymari Chua, Lina Yao Published: 2025-04-04Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-04-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Sample, Don't Search: Rethinking Test-Time Alignment for Language Models Gon莽alo Faria, Noah A. Smith Published: 2025-04-04Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-04-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 14 |
| A Domain-Based Taxonomy of Jailbreak Vulnerabilities in Large Language Models Andr茅s Herrera-Poyatos, Carlos Pel谩ez-Gonz谩lez, Cristina Zuheros, David Herrera-Poyatos Published: 2025-04-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, survey | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, survey | E6 / R4 (96%) | 1 |
| Adversarial Training of Reward Models Adithya Renduchintala, Alexander Bukharin, Haifeng Qian, Oleksii Kuchaiev Published: 2025-04-08Area: Alignment TrainingCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Bridging the Gap Between Preference Alignment and Machine Unlearning Chaochao Chen, Huwei Ji, Jiaming Zhang, Li Zhang Published: 2025-04-09Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-04-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models An Zhang, Junfeng Fang, Kun Wang, Ruipeng Wang Published: 2025-04-09Area: Multimodal SafetyCitations: 34 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 34 |
| Alleviating the Fear of Losing Alignment in LLM Fine-tuning Guanhong Tao, Jun Xu, Kang Yang, Xun Chen Published: 2025-04-13Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-04-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 14 |
| SaRO: Enhancing LLM Safety through Reasoning-based Alignment Shikun Zhang, Wei Ye, Yutao Mou, Yuxiao Luo Published: 2025-04-13Area: Alignment TrainingCitations: 16 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-13 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (98%) | 16 |
| Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? Jian Liang, Jiyang Guan, Ran He, Yanbo Wang Published: 2025-04-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (93%) | 7 |
| Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data Linchao Zhu, Shuai Zhao, Yi Yang Published: 2025-04-14Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-04-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 5 |
| RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability Dongbai Li, Yao Huang, Yichi Zhang, Yinpeng Dong Published: 2025-04-14Area: Alignment TrainingCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-14 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 46 |
| Reward Consistency: Improving Multi-Objective Alignment from a Data-Centric Perspective Jun Zhou, Xin Zhang, Xiting Wang, Yongqi Tong Published: 2025-04-15Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-04-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization Jingjing Dong, Menglan Chen, Siheng Chen, WenHao Wang Published: 2025-04-17Area: Multimodal SafetyCitations: 6 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-17 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? Andrew Zhao, Gao Huang, Rui Lu, Shiji Song Published: 2025-04-18Area: Alignment TrainingCitations: 559 Tags: ai-safety, alignment-training, empirical | 2025-04-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 559 |
| DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization Chun Chen, Churui Zeng, Kedong Xiu, Kui Ren Published: 2025-04-21Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R5 (96%) | 5 |
| Establishing Reliability Metrics for Reward Models in Large Language Models Anxiang Zeng, Guangda Huzhang, Han Yu, Qingtao Yu Published: 2025-04-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-04-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1 |
| Learning Explainable Dense Reward Shapes via Bayesian Optimization Dongyeop Kang, Ian Yang, Kwang-Sung Jun, Mingyi Hong Published: 2025-04-22Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-04-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Safety Pretraining: Toward the Next Generation of Safe AI Alex Robey, Andy Zou, Dylan Sam, J. Zico Kolter Published: 2025-04-23Area: Alignment TrainingCitations: 24 Tags: ai-safety, alignment-training, empirical | 2025-04-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 24 |
| Super Co-alignment of Human and AI for Sustainable Symbiotic Society Bing Han, Boyuan Chen, Chao Liu, Dongcheng Zhao Published: 2025-04-24Area: Scalable OversightCitations: 3 Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-04-24 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E5 / R3 (94%) | 3 |
| Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors Chan-Hung Yu, Chin-Ting Hsu, Kuan-Hao Huang, Ren-Wei Liang Published: 2025-04-27Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-04-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models Chanwoo Park, Dongyeop Kang, Suin Kim, Vipul Raheja Published: 2025-04-28Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-04-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| Characterizing AI Agents for Alignment and Governance Atoosa Kasirzadeh, Iason Gabriel Published: 2025-04-30Area: Agent SafetyCitations: 28 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-04-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E6 / R5 (95%) | 28 |
| XBreaking: Explainable Artificial Intelligence for Jailbreaking LLMs Antonino Nocera, Marco Arazzi, Vignesh Kumar Kembu, Vinod P Published: 2025-04-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| On the Limitations of Steering in Language Model Alignment Chebrolu Niranjan, Gerard Christopher Yeo, Kokil Jaidka Published: 2025-05-02Area: Representation AnalysisCitations: 3 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-05-02 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E4 / R3 (94%) | 3 |
| A Survey on Progress in LLM Alignment from the Perspective of Reward Design Jian Yang, Mark Dras, Miaomiao Ji, Shoujin Wang Published: 2025-05-05Area: Surveys & ReviewsCitations: 10 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-05-05 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (95%) | 10 |
| An Alignment Safety Case Sketch Based on Debate Benjamin Hilton, Geoffrey Irving, Jacob Pfau, Marie Davidsen Buhl Published: 2025-05-06Area: Scalable OversightCitations: 8 Tags: ai-safety, alignment-training, scalable-oversight, theoretical | 2025-05-06 | Scalable Oversight | ai-safety, alignment-training, scalable-oversight, theoretical | E5 / R3 (94%) | 8 |
| LlamaFirewall: An Open Source Guardrail System for Building Secure AI Agents Abraham Montilla, Alekhya Gampa, Beto de Paola, Cyrus Nikolaidis Published: 2025-05-06Area: Adversarial RobustnessCitations: 41 Tags: adversarial-robustness, ai-safety, alignment-training, tool | 2025-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, tool | E5 / R4 (98%) | 41 |
| Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model Chi Chen, Jinan Xu, Kaiyu Huang, Xiangyu Shi Published: 2025-05-10Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | 2025-05-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 11 |
| On the Robustness of Reward Models for Language Model Alignment Aman Gupta, Eunki Kim, Guijin Son, James Thorne Published: 2025-05-12Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, empirical | 2025-05-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 7 |
| Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment Jiahuan Li, Jiazheng Zhang, Jingang Wang, MingXu Chai Published: 2025-05-15Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-05-15 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 2 |