Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation Haimin Hu, Jaime Fern谩ndez Fisac, Kaiqu Liang, Ryan Liu Published: 2025-01-15Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 14 |
| Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment Chaoqi Wang, Chen Zhu, Hao Ma, Jiayi Liu Published: 2025-01-16Area: Deception & FailureCitations: 25 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-01-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 25 |
| Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment Andy Luo, Huy Nghiem, Melissa Kazemi Rad, Mohammad Sorower Published: 2025-01-22Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (95%) | 18 |
| If It's Nice, Do It Twice: We Should Try Iterative Corpus Curation Robin Young Published: 2025-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, position | 2025-01-25 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | - |
| Data-adaptive Safety Rules for Training Reward Models Jingxuan Fan, Mingye Gao, Weiyu Li, Xiaomin Li Published: 2025-01-26Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-01-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 6 |
| Information-theoretic Distinctions Between Deception and Confusion Robin Young Published: 2025-01-27Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2025-01-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | - |
| Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs Eric Pauley, Jean-Charles Noirot Ferrand, Patrick McDaniel, Ryan Sheatsley Published: 2025-01-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation Dacheng Tao, Haotian Luo, Huanjin Yao, Jiaxing Huang Published: 2025-01-30Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 14 |
| PSA: Differentially Private Steering for Large Language Model Alignment Amartya Sanyal, Anmol Goel, Iryna Gurevych, Yaxi Hu Published: 2025-01-30Area: Model EditingCitations: 9 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-01-30 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 9 |
| A Three-Branch Checks-and-Balances Framework for Context-Aware Ethical Alignment of Large Language Models Edward Y. Chang Published: 2025-01-31Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-01-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (95%) | 3 |
| How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers Antonio-Gabriel Chac贸n Menke, Phan Xuan Tan Published: 2025-02-01Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-02-01 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (96%) | 2 |
| LLM Safety Alignment is Divergence Estimation in Disguise Guang Lin, Qifan Song, Rajdeep Haldar, Yue Xing Published: 2025-02-02Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-02-02 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (93%) | 3 |
| FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model Guangliang Cheng, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-02-03Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 1 |
| On Almost Surely Safe Alignment of Large Language Models at Inference-Time Haitham Bou Ammar, Ilija Bogunovic, Jun Wang, Matthieu Zimmer Published: 2025-02-03Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, theoretical | 2025-02-03 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (96%) | 7 |
| Robust LLM Alignment via Distributionally Robust Direct Preference Optimization Deepak Ramachandran, Dileep Kalathil, Kishan Panaganti, Rahul Jain Published: 2025-02-04Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-02-04 | Alignment Training | ai-safety, alignment-training, theoretical | E6 / R3 (95%) | 11 |
| STAIR: Improving Safety Alignment with Introspective Reasoning Dong Yan, Jun Zhu, Ranjie Duan, Siyuan Zhang Published: 2025-02-04Area: Alignment TrainingCitations: 48 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 48 |
| Leveraging Reasoning with Guidelines to Elicit and Utilize Knowledge for Enhancing Safety Alignment Dacheng Tao, Haoyu Wang, Li Shen, Minhao Cheng Published: 2025-02-06Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 10 |
| Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment Harrish Thasarathan, Julian Forsyth, Konstantinos Derpanis, Matthew Kowal Published: 2025-02-06Area: Mechanistic Interp.Citations: 27 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-06 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R3 (97%) | 27 |
| Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs With Minimal Human Interventions Guoshun Nan, Jingxin Xu, Sheng Guan, Sicong Leng Published: 2025-02-08Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 2 |
| You Are What You Eat: AI Alignment Requires Understanding How Data Shapes Structure and Generalisation Alexander Gietelink Oldenziel, Daniel Murfet, George Wang, Jesse Hoogland Published: 2025-02-08Area: Formal/TheoreticalCitations: 9 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-02-08 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E5 / R4 (96%) | 9 |
| Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis Aran Nayebi Published: 2025-02-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-02-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E4 / R3 (93%) | 4 |
| A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks Hieu Minh Nguyen Published: 2025-02-10Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2025-02-10 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (92%) | 5 |
| Universal Adversarial Attack on Aligned Multimodal LLMs Andrey Kuznetsov, Anton Razzhigaev, Matvey Mikhalchuk, Polina Druzhinina Published: 2025-02-11Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation Cheng Ji, Feihong Lu, Jianxin Li, Qian Li Published: 2025-02-13Area: Surveys & ReviewsCitations: 2 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-02-13 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (97%) | 2 |
| QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language Jingyu Xiao, Kuofeng Gao, Li Xu, Qing Li Published: 2025-02-13Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 9 |
| The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions Haining Yu, Qiguang Chen, Wenbo Pan, Xiangyang Zhou Published: 2025-02-13Area: Mechanistic Interp.Citations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-13 | Mechanistic Interp. | adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | 8 |
| VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap Chaowei Xiao, Fei Wang, Muhao Chen, Qin Liu Published: 2025-02-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 7 |
| Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment Animesh Mukherjee, Pratyush Chatterjee, Rima Hazra, Sayan Layek Published: 2025-02-16Area: Model EditingCitations: 5 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 5 |
| Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives Gauthier Gidel, Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann Published: 2025-02-17Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, position | 2025-02-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, position | E4 / R3 (94%) | 7 |
| Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang Published: 2025-02-17Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |