Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt Ahmed Salem, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Position: Capability Control Should be a Separate Goal From Alignment Adrian Weller, David Krueger, Eleni Triantafillou, Shoaib Ahmed Siddiqui Published: 2026-02-05Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2026-02-05 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (94%) | - |
| Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities Dietrich Klakow, Felix Michalak, Florian Dietz, Gustavo Ewbank Rodrigues Danon Published: 2026-02-05Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | - |
| From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents Fanyu Meng, Haoran Gao, Li Sun, Sen Su Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models Binghai Wang, Bowen Yu, Chang Gao, Chujie Zheng Published: 2026-02-04Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 1 |
| RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning Qiaosheng Zhang, Xia Hu, Xingcheng Xu, Zeming Wei Published: 2026-02-04Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Steering LLMs via Scalable Interactive Oversight Enyu Zhou, Guoteng Wang, Hang Yan, Long Ma Published: 2026-02-04Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2026-02-04 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (94%) | - |
| Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning Himabindu Lakkaraju, Shan Chen, Zidi Xiong Published: 2026-02-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-03 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| Alignment-Aware Model Adaptation via Feedback-Guided Optimization Aditya Chinchure, Gaurav Bhatt, Jiawei Zhou, Leonid Sigal Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment Junyuan Hong, Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R4 (93%) | - |
| Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO Akifumi Wachi, Kohei Miyaguchi, Rei Higuchi, Shokichi Takakura Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (93%) | - |
| Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron Binghao Wang, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Reward-free Alignment for Conflicting Objectives Peter L. Chen, Tianyi Lin, Xiaopeng Li, Xi Chen Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment Byeonghu Na, HeeSun Bae, Hyungho Na, Il-Chul Moon Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| BLOCK-EM: Preventing Emergent Misalignment by Blocking Causal Features Guannan Qu, Muhammed Ustaomeroglu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R2 (95%) | - |
| Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective Ce Li, Haichuan Wang, Hezi Jiang, Lingkai Kong Published: 2026-01-31Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2026-01-31 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | - |
| Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning Abhishek Mishra, Deepesh Suranjandass, Donnie Winkelmann, Mugilan Arulvanan Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures Jie Zhang, Nenghai Yu, Qiu Han, Tianwei Zhang Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Real-Time Aligned Reward Model beyond Semantics Deqing Wang, Fuzhen Zhuang, Hongyan Xie, Jianbin Zheng Published: 2026-01-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| The Alignment Curse: Cross-Modality Jailbreak Transfer in Omni-Models Adel Bibi, Aoxi Liu, Junchi Yu, Philip Torr Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (92%) | - |
| The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity? Alexander H盲gele, Aryo Pradipta Gema, Ethan Perez, Henry Sleight Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Factored Causal Representation Learning for Robust Reward Modeling in RLHF Biwei Huang, Fan Feng, Lei Xu, Lin Qu Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| Shaping capabilities with token-level data filtering Alec Radford, Neil Rathi Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Reward Models Inherit Value Biases from Pretraining Brian Christian, Christopher Summerfield, Elle Michelle Yang, Hannah Rose Kirk Published: 2026-01-28Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment Dongxia Wang, Haonan Zhang, Kexin Chen, Wenhai Wang Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | - |
| Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values Bochu Ding, Brandon Fain, Henry Bell, Lara Neubauer da Costa Schertel Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing Akanksha Dadlani, Darja Djordjevic, Duncan Eddy, Eugenia Kim Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | - |