Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Repairing Reward Functions with Feedback to Mitigate Reward Hacking Emma Brunskill, Logan Mondal Bhamidipaty, Stephane Hatgis-Kessell Published: 2025-10-14Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs Denise Alejandra Mester, Eitan Sprejer, Facundo Nieto, Francisca Gauna Selasco Published: 2025-10-15Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-10-15 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (93%) | - |
| Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment Boxuan Wang, Guangliang Cheng, Jinwei Hu, Lokesh Singh Published: 2025-10-15Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, position | 2025-10-15 | Agent Safety | agent-safety, ai-safety, alignment-training, position | E4 / R3 (92%) | 4 |
| Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL Aryansh Shrivastava, Marwa Abdulhai, Natasha Jaques, Ryan Cheng Published: 2025-10-16Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (96%) | 1 |
| HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment Jing Shao, Lijun Li, Xingjun Wang, Yuexiao Liu Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth Andrew Estornell, Bo Li, David D. Baek, Jiawei Zhang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs Chao Deng, Chong Long, Di Jin, Duqing Wang Published: 2025-10-20Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Extracting alignment data in open models Chawin Sitawarin, Christopher A. Choquette-Choo, Federico Barbero, Ilia Shumailov Published: 2025-10-21Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-21 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 3 |
| Rectifying Shortcut Behaviors in Preference-based Reward Learning Aidong Zhang, Guangtao Zheng, Wenqian Ye Published: 2025-10-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Subliminal Corruption: Mechanisms, Thresholds, and Interpretability Reya Vir, Sarvesh Bhatnagar Published: 2025-10-22Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical, interpretability | 2025-10-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, interpretability | E5 / R3 (95%) | 1 |
| Ask a Strong LLM Judge when Your Reward Model is Uncertain Changlong Yu, Haoming Jiang, Hyokun Yun, Ilgee Hong Published: 2025-10-23Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-10-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training Stephen H. Bach, Zheng-Xin Yong Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference Aidan Li, Rob Brekelmans, Roger Grosse, Stephen Zhao Published: 2025-10-24Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-24 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Debiasing Reward Models by Representation Learning with Guarantees Ignavier Ng, Kun Zhang, Patrick Bl枚baum, Shiva Kasiviswanathan Published: 2025-10-27Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, theoretical | 2025-10-27 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 1 |
| The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy Mohsen Bayati, William Overman Published: 2025-10-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | 2025-10-30 | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 1 |
| Value Drifts: Tracing Value Alignment During LLM Post-Training Gaurav Kamath, Karolina Sta艅czak, Marius Mosbach, Mehar Bhatia Published: 2025-10-30Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E9 / R4 (96%) | 3 |
| What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data Emma Pierson, Rajiv Movva, Sewon Min, Smitha Milli Published: 2025-10-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Atlas-Alignment: Making Interpretability Transferable Across Language Models Bruno Puri, Jim Berend, Sebastian Lapuschkin, Wojciech Samek Published: 2025-10-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-10-31 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | - |
| Consistency Training Helps Stop Sycophancy and Jailbreaks Alexander Matt Turner, Alex Irpan, David K. Elson, Mark Kurzeja Published: 2025-10-31Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs Amin Nikanjam, Foutse Khomh, Mina Taraghi, Mohamed Amine Merzouk Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (95%) | - |
| Reimagining Safety Alignment with An Image Guorui Chen, Jindong Gu, Philip Torr, Wenqian Yu Published: 2025-11-01Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-01 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (95%) | 1 |
| Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI Evan Hubinger, Henning Bartsch, Nathan Lambert, Sharan Maiya Published: 2025-11-03Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-11-03 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 3 |
| Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior Aishwarya Balwani, Andrew Ansah, Ashwinee Panda, Daniel Aarao Reis Arturi Published: 2025-11-03Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-03 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 2 |
| The Realignment Problem: When Right becomes Wrong in LLMs Aakash Sen Sharma, Debdeep Sanyal, Murari Mandal, Shirish Karande Published: 2025-11-04Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Control Barrier Function for Aligning Large Language Models Masaki Inoue, Yuya Miyaoka Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (96%) | 2 |
| STARS: Segment-level Token Alignment with Rejection Sampling in Large Language Models Mikhail Kuznetsov, Mohammad Areeb, Mohammad Atif Quamar, Muslum Ozgur Ozmen Published: 2025-11-05Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-05 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits Ashwinee Panda, Dev Patel, Diekola Raimi, Gabriel Grand Published: 2025-11-09Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-11-09 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (97%) | 1 |
| EASE: Practical and Efficient Safety Alignment for Small Language Models An Wang, Guoli Wang, Haonan Shi, Tu Ouyang Published: 2025-11-09Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization Xiangliang Zhang, Xiangqi Wang, Yue Huang Published: 2025-11-09Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 1 |
| Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment Peijie Sun, Peng Zhang Published: 2025-11-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |