Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking Junshan Zhang, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2026-02-02Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2026-02-02 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |
| AGT-AO: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality Bifan Wei, Huan Liu, Jun Liu, Lingling Zhang Published: 2026-02-02Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (96%) | - |
| David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning Samuel Nellessen, Tal Kachman Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs Cheng-Kuang Wu, Yen-Shan Chen, Yun-Nung Chen, Zhi Rui Tam Published: 2026-02-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron Binghao Wang, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety Chaochao Lu, Han Qi, Qiaosheng Zhang, Tianhang Zheng Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | - |
| RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse Cheng Long, Kwok-Yan Lam, Mingrui Liu, Sixiao Zhang Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models Amit LeVi, Avi Mendelson, Chaim Baskin, Elad Hirshel Published: 2026-02-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models Christopher Leckie, Hanxun Huang, Kaiyuan Cui, Sarah Erfani Published: 2026-02-01Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| A Causal Perspective for Enhancing Jailbreak Attack and Defense Haozhe Feng, Hui Xue, Jialing Tao, Jiexi Liu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Jailbreaking LLMs via Calibration Yongkang Guo, Yuqing Kong, Yuxuan Lu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | - |
| Self-Guard: Defending Large Reasoning Models via Enhanced Self-Reflection An Zhang, Chenhang Cui, Gelei Deng, Jingjun Xu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Text is All You Need for Vision-Language Model Jailbreaking Cho-Jui Hsieh, Tianle Zheng, Yihang Chen, Youyuan Jiang Published: 2026-01-31Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Unifying Adversarial Robustness and Training Across Text Scoring Models Hosna Oyarhoseini, Jimmy Lin, Manveer Singh Tamber Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (94%) | - |
| A Fragile Guardrail: Diffusion LLM's Safety Blessing and Its Failure Mode Adel Bibi, Eric Sommerlade, Jialin Yu, Junchi Yu Published: 2026-01-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| Safer Policy Compliance with Dynamic Epistemic Fallback Harish Tayyar Madabushi, Joseph Marvin Imperial Published: 2026-01-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| The Alignment Curse: Cross-Modality Jailbreak Transfer in Omni-Models Adel Bibi, Aoxi Liu, Junchi Yu, Philip Torr Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (92%) | - |
| Factored Causal Representation Learning for Robust Reward Modeling in RLHF Biwei Huang, Fan Feng, Lei Xu, Lin Qu Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs Bo Li, Cong Wang, Hanxun Huang, Xiang Zheng Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | - |
| RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing Huiyu Xu, Kui Ren, Wenhui Zhang, Xuelin Wei Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention Chuancheng Shi, Cong Wang, Fei Shen, Shangze Li Published: 2026-01-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack Chunming Wu, Jiahao Yu, Lei Xue, Renke Huang Published: 2026-01-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Reinforcement Unlearning via Group Relative Policy Optimization Bardh Prenkaj, Efstratios Zaradoukas, Gjergji Kasneci Published: 2026-01-28Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-28 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| GAVEL: Towards Rule-Based Safety Through Activation Monitoring Eyal Lenga, Gilad Gressel, Itay Zloczower, Rahul Pankajakshan Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| LLMs Can Unlearn Refusal with Only 1,000 Benign Samples Mohan Kankanhalli, Si Liu, Yangyang Guo, Zhiming Zheng Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment Dongxia Wang, Haonan Zhang, Kexin Chen, Wenhai Wang Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | - |
| Proactive Hardening of LLM Defenses with HASTE Henry Chen, Nicole Nichols, Ryan Heartfield, Samarth Keshari Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks Albert Zomaya, Jack Yang, Jo Plested, Kanchana Thilakarathna Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models Alina Oprea, Ethan Rathbun, Hanna Foerster, Harsh Chaudhari Published: 2026-01-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems Dmitry Namiot, Narek Maloyan Published: 2026-01-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, survey | 2026-01-24 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (97%) | - |