Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization HyunJin Kim, James Evans, Jing Yao, JinYeong Bak Published: 2025-03-08Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-03-08 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E6 / R3 (93%) | - |
| Adding Alignment Control to Language Models Rui Wang, Weinan Zhang, Wenhong Zhu Published: 2025-03-06Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-03-06 | Alignment Training | ai-safety, alignment-training, empirical | E8 / R6 (94%) | - |
| Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety Ding Zhao, Miao Li, William Han, Yihang Yao Published: 2025-03-06Area: Alignment TrainingCitations: 21 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 21 |
| Improving LLM Safety Alignment with Dual-Objective Optimization David Huang, Dawn Song, Licong Lin, Song Mei Published: 2025-03-05Area: Alignment TrainingCitations: 22 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-05 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 22 |
| SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Safe Reinforcement Learning Borong Zhang, Jiaming Ji, Josef Dai, Yaodong Yang Published: 2025-03-05Area: Agent SafetyCitations: 9 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-03-05 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 9 |
| The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems Adam Khoja, Alice Gatti, Arunim Agarwal, Brad Kenstler Published: 2025-03-05Area: Safety EvaluationCitations: 26 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-03-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 26 |
| LLM Misalignment via Adversarial RLHF Platforms Ali Naseh, Erfan Entezami Published: 2025-03-04Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (94%) | 3 |
| Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2025-03-01Area: Alignment TrainingCitations: 80 Tags: ai-safety, alignment-training, empirical | 2025-03-01 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 80 |
| The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents Bo Wang, Jie Liu, Kehai Chen, Min Zhang Published: 2025-02-28Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-02-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 3 |
| One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs Arman Cohan, Jacob Dunefsky Published: 2025-02-26Area: Representation AnalysisCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-02-26 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (94%) | 9 |
| Reward Shaping to Mitigate Reward Hacking in RLHF Chengyuan Yao, Heng Wang, Jiayi Fu, Qi Han Published: 2025-02-26Area: Alignment TrainingCitations: 54 Tags: ai-safety, alignment-training, empirical | 2025-02-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 54 |
| Emergent Misalignment: Narrow Finetuning Can Produce Broadly Misaligned LLMs Anna Sztyber-Betley, Daniel Tan, Jan Betley, Mart脙颅n Soto Published: 2025-02-24Area: Deception & FailureCitations: 113 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-02-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 113 |
| SAE-V: Interpreting Multimodal Models for Enhanced Alignment Changye Li, Hantao Lou, Jiaming Ji, Yaodong Yang Published: 2025-02-22Area: Mechanistic Interp.Citations: 8 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-22 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R3 (96%) | 8 |
| Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh, Pedram Zaree Published: 2025-02-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| C3AI: Crafting and Evaluating Constitutions for Constitutional AI Daniele Quercia, Edyta Bogucka, Ke Zhou, Yara Kyrychenko Published: 2025-02-21Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2025-02-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 15 |
| A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos Liang Liu, Lujundong Li, Ruofan Wang, Xuan Tong Published: 2025-02-19Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 27 |
| Safe at the Margins: A General Approach to Safety Alignment in Low-Resource English Languages - A Singlish Case Study Goh Jiayi, Isaac Lim, Jessica Foo, Shaun Khoo Published: 2025-02-18Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-02-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 4 |
| SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings Cen Chen, Hao Peng, Huiping Zhuang, Shien-Ming Wu Published: 2025-02-18Area: Multimodal SafetyCitations: 5 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives Gauthier Gidel, Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann Published: 2025-02-17Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, position | 2025-02-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, position | E4 / R3 (94%) | 7 |
| Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang Published: 2025-02-17Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models Bo Zheng, Jiaheng Liu, Wenbo Su, Xiangyu Yue Published: 2025-02-17Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2025-02-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 18 |
| Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment Animesh Mukherjee, Pratyush Chatterjee, Rima Hazra, Sayan Layek Published: 2025-02-16Area: Model EditingCitations: 5 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 5 |
| VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap Chaowei Xiao, Fei Wang, Muhao Chen, Qin Liu Published: 2025-02-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 7 |
| A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation Cheng Ji, Feihong Lu, Jianxin Li, Qian Li Published: 2025-02-13Area: Surveys & ReviewsCitations: 2 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-02-13 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (97%) | 2 |
| QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language Jingyu Xiao, Kuofeng Gao, Li Xu, Qing Li Published: 2025-02-13Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 9 |
| The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions Haining Yu, Qiguang Chen, Wenbo Pan, Xiangyang Zhou Published: 2025-02-13Area: Mechanistic Interp.Citations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-13 | Mechanistic Interp. | adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | 8 |
| Universal Adversarial Attack on Aligned Multimodal LLMs Andrey Kuznetsov, Anton Razzhigaev, Matvey Mikhalchuk, Polina Druzhinina Published: 2025-02-11Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks Hieu Minh Nguyen Published: 2025-02-10Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2025-02-10 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (92%) | 5 |
| Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis Aran Nayebi Published: 2025-02-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-02-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E4 / R3 (93%) | 4 |
| Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs With Minimal Human Interventions Guoshun Nan, Jingxin Xu, Sheng Guan, Sicong Leng Published: 2025-02-08Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 2 |