Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs Bo Li, Cong Wang, Hanxun Huang, Xiang Zheng Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | - |
| Knowledge Vector Weakening: Efficient Training-free Unlearning for Large Vision-Language Models Dongjun Hwang, Junsuk Choe, Sungmin Cha, Yejin Kim Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units Jianhui Chen, Liangming Pan, Yuzhang Luo Published: 2026-01-29Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2026-01-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| Per-parameter Task Arithmetic for Unlearning in Large Language Models Bo Han, Chengyi Cai, Feng Liu, Jiangchao Yao Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (96%) | - |
| RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing Huiyu Xu, Kui Ren, Wenhui Zhang, Xuelin Wei Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Shaping capabilities with token-level data filtering Alec Radford, Neil Rathi Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models Jacek Duszenko Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-29 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention Chuancheng Shi, Cong Wang, Fei Shen, Shangze Li Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning Bo Han, Chengyi Cai, Feng Liu, Jianzhong Qi Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models Jon Chun, Katherine Elkins Published: 2026-01-29Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-01-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Concept Component Analysis: A Principled Approach for Concept Extraction in LLMs Anton van den Hengel, Dong Gong, Erdun Gao, Javen Qinfeng Shi Published: 2026-01-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation Kexin Huang, Lingyu Li, Ruilin Luo, Shiyang Huang Published: 2026-01-28Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2026-01-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | 1 |
| ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack Chunming Wu, Jiahao Yu, Lei Xue, Renke Huang Published: 2026-01-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Reinforcement Unlearning via Group Relative Policy Optimization Bardh Prenkaj, Efstratios Zaradoukas, Gjergji Kasneci Published: 2026-01-28Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-28 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Reward Models Inherit Value Biases from Pretraining Brian Christian, Christopher Summerfield, Elle Michelle Yang, Hannah Rose Kirk Published: 2026-01-28Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-28 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction Cameron Allen, Micah Carroll, Tianyi Alex Qiu Published: 2026-01-28Area: Scalable OversightCitations: - Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2026-01-28 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (95%) | - |
| GAVEL: Towards Rule-Based Safety Through Activation Monitoring Eyal Lenga, Gilad Gressel, Itay Zloczower, Rahul Pankajakshan Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| LLMs Can Unlearn Refusal with Only 1,000 Benign Samples Mohan Kankanhalli, Si Liu, Yangyang Guo, Zhiming Zheng Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment Dongxia Wang, Haonan Zhang, Kexin Chen, Wenhai Wang Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | - |
| Proactive Hardening of LLM Defenses with HASTE Henry Chen, Nicole Nichols, Ryan Heartfield, Samarth Keshari Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection Chris Ngo, Quy-Anh Dang Published: 2026-01-27Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-27 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks Albert Zomaya, Jack Yang, Jo Plested, Kanchana Thilakarathna Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models Alina Oprea, Ethan Rathbun, Hanna Foerster, Harsh Chaudhari Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| A Few Bad Neurons: Isolating and Surgically Correcting Sycophancy Aditya Dwivedi, Ashwinee Panda, Claire O'Brien, Dristi Roy Published: 2026-01-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values Bochu Ding, Brandon Fain, Henry Bell, Lara Neubauer da Costa Schertel Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing Akanksha Dadlani, Darja Djordjevic, Duncan Eddy, Eugenia Kim Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale Brandon Fain, Caroline Zhang, Dhaval Potdar, Henry Bell Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (95%) | - |
| TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment Duohe Ma, Huiyan Jin, Jianfeng Si, Jiawen Tao Published: 2026-01-26Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R5 (96%) | - |
| Unsupervised Elicitation of Moral Values from Language Models Fabrizio Gilardi, Meysam Alizadeh, Zeynab Samei Published: 2026-01-25Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-25 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |