Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| You Are What You Eat: AI Alignment Requires Understanding How Data Shapes Structure and Generalisation Alexander Gietelink Oldenziel, Daniel Murfet, George Wang, Jesse Hoogland Published: 2025-02-08Area: Formal/TheoreticalCitations: 9 Tags: ai-safety, alignment-training, formaltheoretical, position | 2025-02-08 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, position | E5 / R4 (96%) | 9 |
| Leveraging Reasoning with Guidelines to Elicit and Utilize Knowledge for Enhancing Safety Alignment Dacheng Tao, Haoyu Wang, Li Shen, Minhao Cheng Published: 2025-02-06Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 10 |
| Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment Harrish Thasarathan, Julian Forsyth, Konstantinos Derpanis, Matthew Kowal Published: 2025-02-06Area: Mechanistic Interp.Citations: 27 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-06 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R3 (97%) | 27 |
| Robust LLM Alignment via Distributionally Robust Direct Preference Optimization Deepak Ramachandran, Dileep Kalathil, Kishan Panaganti, Rahul Jain Published: 2025-02-04Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, theoretical | 2025-02-04 | Alignment Training | ai-safety, alignment-training, theoretical | E6 / R3 (95%) | 11 |
| STAIR: Improving Safety Alignment with Introspective Reasoning Dong Yan, Jun Zhu, Ranjie Duan, Siyuan Zhang Published: 2025-02-04Area: Alignment TrainingCitations: 48 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 48 |
| FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model Guangliang Cheng, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-02-03Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 1 |
| On Almost Surely Safe Alignment of Large Language Models at Inference-Time Haitham Bou Ammar, Ilija Bogunovic, Jun Wang, Matthieu Zimmer Published: 2025-02-03Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, theoretical | 2025-02-03 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (96%) | 7 |
| LLM Safety Alignment is Divergence Estimation in Disguise Guang Lin, Qifan Song, Rajdeep Haldar, Yue Xing Published: 2025-02-02Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-02-02 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (93%) | 3 |
| How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers Antonio-Gabriel Chac贸n Menke, Phan Xuan Tan Published: 2025-02-01Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-02-01 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (96%) | 2 |
| A Three-Branch Checks-and-Balances Framework for Context-Aware Ethical Alignment of Large Language Models Edward Y. Chang Published: 2025-01-31Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-01-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (95%) | 3 |
| Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation Dacheng Tao, Haotian Luo, Huanjin Yao, Jiaxing Huang Published: 2025-01-30Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 14 |
| PSA: Differentially Private Steering for Large Language Model Alignment Amartya Sanyal, Anmol Goel, Iryna Gurevych, Yaxi Hu Published: 2025-01-30Area: Model EditingCitations: 9 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-01-30 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 9 |
| Information-theoretic Distinctions Between Deception and Confusion Robin Young Published: 2025-01-27Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2025-01-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | - |
| Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs Eric Pauley, Jean-Charles Noirot Ferrand, Patrick McDaniel, Ryan Sheatsley Published: 2025-01-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Data-adaptive Safety Rules for Training Reward Models Jingxuan Fan, Mingye Gao, Weiyu Li, Xiaomin Li Published: 2025-01-26Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-01-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 6 |
| If It's Nice, Do It Twice: We Should Try Iterative Corpus Curation Robin Young Published: 2025-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, position | 2025-01-25 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | - |
| Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment Andy Luo, Huy Nghiem, Melissa Kazemi Rad, Mohammad Sorower Published: 2025-01-22Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (95%) | 18 |
| Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment Chaoqi Wang, Chen Zhu, Hao Ma, Jiayi Liu Published: 2025-01-16Area: Deception & FailureCitations: 25 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-01-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 25 |
| RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation Haimin Hu, Jaime Fern谩ndez Fisac, Kaiqu Liang, Ryan Liu Published: 2025-01-15Area: Alignment TrainingCitations: 14 Tags: ai-safety, alignment-training, empirical | 2025-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 14 |
| Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision Cassidy Laidlaw, Jacob Steinhardt, Yaowen Ye Published: 2025-01-14Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-01-14 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (95%) | 3 |
| Understanding Impact of Human Feedback via Influence Functions Haeone Lee, Hanho Ryu, Kimin Lee, Taywon Min Published: 2025-01-10Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, empirical | 2025-01-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (94%) | 7 |
| Analyzing Fine-tuning Representation Shift for Multimodal LLMs Steering alignment Jayneel Parekh, Matthieu Cord, Mustafa Shukor, Pegah Khayatan Published: 2025-01-06Area: Representation AnalysisCitations: 8 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-01-06 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (96%) | 8 |
| Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective Fangwei Zhong, Hengli Li, Junqi Wang, Mengmeng Wang Published: 2024-12-31Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2024-12-31 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Large Language Model Safety: A Holistic Survey Bojian Jiang, Chuang Liu, Dan Shi, Deyi Xiong Published: 2024-12-23Area: Surveys & ReviewsCitations: 47 Tags: adversarial-robustness, ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2024-12-23 | Surveys & Reviews | adversarial-robustness, ai-safety, alignment-training, interpretability, survey, surveys-reviews | E7 / R5 (99%) | 47 |
| Chained Tuning Leads to Biased Forgetting Adina Williams, Alicia Sun, Bhaktipriya Radharapu, Levent Sagun Published: 2024-12-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2024-12-21 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 1 |
| OpenAI o1 System Card Aaron Jaech, Adam Kalai, Adam Lerer, Ahmed El-Kishky Published: 2024-12-21Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| The Road to Artificial SuperIntelligence: A Comprehensive Survey of Superalignment HyunJin Kim, Jianxun Lian, Jing Yao, JinYeong Bak Published: 2024-12-21Area: Surveys & ReviewsCitations: 9 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-12-21 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R3 (94%) | 9 |
| The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents Anna Squicciarini, Feiran Jia, Tong Wu, Xin Qin Published: 2024-12-21Area: Agent SafetyCitations: 26 Tags: agent-safety, ai-safety, alignment-training, empirical | 2024-12-21 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 26 |
| When Can Proxies Improve the Sample Complexity of Preference Learning? Alexander D'Amour, Daniel Augusto de Souza, Matt J. Kusner, Mengyue Yang Published: 2024-12-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2024-12-21 | Alignment Training | ai-safety, alignment-training, theoretical | E4 / R3 (95%) | 1 |
| Deliberative Alignment: Reasoning Enables Safer Language Models Alec Helyar, Alex Beutel, Amelia Glaese, Andrea Vallone Published: 2024-12-20Area: Alignment TrainingCitations: 210 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-12-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 210 |