Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Consistency Training Helps Stop Sycophancy and Jailbreaks Alexander Matt Turner, Alex Irpan, David K. Elson, Mark Kurzeja Published: 2025-10-31Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Diffusion LLMs are Natural Adversaries for any LLM David L眉dke, Leo Schwinn, Paul Ungermann, Stephan G眉nnemann Published: 2025-10-31Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels Chenghao Du, Quanfeng Huang, Tingxuan Tang, Yue Xiao Published: 2025-10-31Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-10-31 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E4 / R3 (96%) | - |
| ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models Derui Wang, Jie Hao, Jin Song Dong, Junjie Su Published: 2025-10-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Chain-of-Thought Hijacking Fazl Barez, Jianli Zhao, Mrinank Sharma, Rylan Schaeffer Published: 2025-10-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Reasoning Up the Instruction Ladder for Controllable Language Models Chan Young Park, Faeze Brahman, Sachin Kumar, Vidhisha Balachandran Published: 2025-10-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning Ahmed Elgohary, Amin Saied, A S M Iftekhar, Kaiwen Zhou Published: 2025-10-30Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 1 |
| Agentic Moderation: Multi-Agent Design for Safer Vision-Language Models Juan Ren, Mark Dras, Usman Naseem Published: 2025-10-29Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 1 |
| Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning Kokil Jaidka, Niranjan Chebrolu, Svetlana Churina Published: 2025-10-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | - |
| RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline Andr茅 V. Duarte, Arlindo L. Oliveira, Bin Zeng, Lei Li Published: 2025-10-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts Huashan Chen, Lin Wang, Wanqian Zhang, Weiping Wang Published: 2025-10-28Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents Dongdong She, Kaikai Zhang, Mingyu Luo, Ping Chen Published: 2025-10-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Retracing the Past: LLMs Emit Training Data When They Get Lost Adam Nguyen, Charles Fleming, Ming Jin, Myeongseob Ko Published: 2025-10-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models Chengyu Liu, Jingwen Ye, Lexiang Xiong, Yan Liu Published: 2025-10-26Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-10-26 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency Michael Backes, Mingjie Li, Yang Zhang, Yukun Jiang Published: 2025-10-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Adversarial D茅j脿 Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks Charith Peris, Jiachen T. Wang, Mahavir Dabas, Ming Jin Published: 2025-10-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 1 |
| Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses Kar Wai Fok, Vrizlynn L.L. Thing, Xingwei Zhong Published: 2025-10-24Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | - |
| Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference Aidan Li, Rob Brekelmans, Roger Grosse, Stephen Zhao Published: 2025-10-24Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-24 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning Cheng Long, Kwok Yan Lam, Mingrui Liu, Sixiao Zhang Published: 2025-10-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 1 |
| Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models Alexander Robey, Andrej Risteski, Avi Schwarzschild, Frauke Kreuter Published: 2025-10-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations Divyanshu Kumar, Nitin Aravind Birur, Prashanth Harshangi, Sahil Agarwal Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments? Chiyu Chen, Gongshen Liu, Haodong Zhao, Jie Li Published: 2025-10-23Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R4 (97%) | 2 |
| SAID: Empowering Large Language Models with Self-Activating Internal Defense Chao Huang, Jiawen Zhang, Jie Wen, Mu Li Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training Stephen H. Bach, Zheng-Xin Yong Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Defending Against Prompt Injection with DataFilter Basel Alomair, David Wagner, Raghad Alkhudair, Sizhe Chen Published: 2025-10-22Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models Daniel Takabi, Eduardo Blanco, Javad Rafiei Asl, Mohammad Ghasemigol Published: 2025-10-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |
| Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation Giovanni De Muri, Mark Vero, Martin Vechev, Robin Staab Published: 2025-10-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Agentic Reinforcement Learning for Search is Unsafe Adam Mahdi, Andrew Lee, Shreyansh Padarha, Yushi Yang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth Andrew Estornell, Bo Li, David D. Baek, Jiawei Zhang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs Chao Deng, Chong Long, Di Jin, Duqing Wang Published: 2025-10-20Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |