Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity? Alexander H盲gele, Aryo Pradipta Gema, Ethan Perez, Henry Sleight Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| BLOCK-EM: Preventing Emergent Misalignment by Blocking Causal Features Guannan Qu, Muhammed Ustaomeroglu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R2 (95%) | - |
| Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective Ce Li, Haichuan Wang, Hezi Jiang, Lingkai Kong Published: 2026-01-31Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-31 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | - |
| Alignment-Aware Model Adaptation via Feedback-Guided Optimization Aditya Chinchure, Gaurav Bhatt, Jiawei Zhou, Leonid Sigal Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment Junyuan Hong, Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R4 (93%) | - |
| Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO Akifumi Wachi, Kohei Miyaguchi, Rei Higuchi, Shokichi Takakura Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron Binghao Wang, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Reward-free Alignment for Conflicting Objectives Peter L. Chen, Tianyi Lin, Xiaopeng Li, Xi Chen Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment Byeonghu Na, HeeSun Bae, Hyungho Na, Il-Chul Moon Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning Himabindu Lakkaraju, Shan Chen, Zidi Xiong Published: 2026-02-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-03 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents Fanyu Meng, Haoran Gao, Li Sun, Sen Su Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models Binghai Wang, Bowen Yu, Chang Gao, Chujie Zheng Published: 2026-02-04Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 1 |
| RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning Qiaosheng Zhang, Xia Hu, Xingcheng Xu, Zeming Wei Published: 2026-02-04Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Steering LLMs via Scalable Interactive Oversight Enyu Zhou, Guoteng Wang, Hang Yan, Long Ma Published: 2026-02-04Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2026-02-04 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (94%) | - |
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt Ahmed Salem, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Position: Capability Control Should be a Separate Goal From Alignment Adrian Weller, David Krueger, Eleni Triantafillou, Shoaib Ahmed Siddiqui Published: 2026-02-05Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2026-02-05 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (94%) | - |
| Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities Dietrich Klakow, Felix Michalak, Florian Dietz, Gustavo Ewbank Rodrigues Danon Published: 2026-02-05Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | - |
| Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| ShallowJail: Steering Jailbreaks against Large Language Models Hanyu Pei, Shang Liu, Zeyan Liu Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (97%) | - |
| Controllable Value Alignment in Large Language Models through Neuron-Level Editing Fengbin Zhu, Jilong Liu, Junwei Li, Le Wu Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery Bangwei Guo, Difei Gu, Dimitris Metaxas, Gerasimos Chatzoudis Published: 2026-02-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2026-02-07 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | - |
| Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control Jilong Liu, Junfeng Fang, Le Wu, Richang Hong Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Emergent Misalignment is Easy, Narrow Misalignment is Hard Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms Adith N Reganti, Bagesh Kumar, Hardik Sharma, Soham Wasmatkar Published: 2026-02-08Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-08 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R4 (96%) | - |
| Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities Majid Ghasemi, Mark Crowley Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (96%) | - |
| Robustness of Vision Language Models Against Split-Image Harmful Input Attacks Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Shagufta Mehnaz, Vishnu Asutosh Dasu Published: 2026-02-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection Guanglong Sun, Hang Su, Jun Zhu, Liyuan Wang Published: 2026-02-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |