Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning Mingu Kang, Seungyul Han, Sunwoo Lee, Yonghyeon Jo Published: 2026-05-18Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-05-18 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E7 / R6 (92%) | - |
| Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP Adrian Taylor, Chung-Horng Lung, Igor Bogdanov, Jie Gao Published: 2026-05-15Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-05-15 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E14 / R12 (93%) | - |
| Finding the Weakest Link: Adversarial Attack against Multi-Agent Communications Claudia Szabo, Junae Kim, Maxwell Standen Published: 2026-05-13Area: cs.LGCitations: 36 Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-05-13 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E10 / R9 (92%) | 36 |
| GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives Alexandre Le Mercier, Chris Develder, Thomas Demeester Published: 2026-05-09Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-05-09 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E10 / R8 (93%) | - |
| Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking Chaochao Lu, Dongrui Liu, Han Qi, Peng Yu Published: 2026-05-09Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-05-09 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E10 / R9 (91%) | - |
| LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight David Williams-King, Lennart Wachowiak, Samuele Marro, Scott D. Blain Published: 2026-05-08Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-05-08 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E9 / R9 (92%) | - |
| OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing Fanjiang Xu, Jianming Chen, Junjie Wang, Qing Wang Published: 2026-05-08Area: cs.MACitations: - Tags: adversarial-robustness, ai-safety, csma, preprint | 2026-05-08 | cs.MA | adversarial-robustness, ai-safety, csma, preprint | E10 / R10 (92%) | - |
| Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure Abdoul-Aziz Maiga, Diego F. Cuadros Published: 2026-04-29Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-29 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E6 / R6 (90%) | - |
| Jailbreaking Frontier Foundation Models Through Intention Deception Katia Sycara, Xinhe Wang, Yaqi Xie Published: 2026-04-27Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-27 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E7 / R5 (97%) | - |
| Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training Baocai Yin, Bo Wang, Lihe Zhang, Mengnan Zhao Published: 2026-04-27Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-04-27 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E8 / R4 (97%) | - |
| Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines Kim-Kwang Raymond Choo, Mazal Bethany, Nishant Vishwamitra, Peyman Najafirad Published: 2026-04-26Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-26 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E8 / R5 (98%) | - |
| Thinking Like a Clinician: A Cognitive AI Agent for Clinical Diagnosis via Panoramic Profiling and Adversarial Debate Duofan Tu, Heqin Zhu, Jun Li, Mingyue Zhao Published: 2026-04-26Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-26 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E8 / R5 (98%) | - |
| CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning Aming Wu, Chaoning Zhang, Haoyu Bian, Hyundong Shin Published: 2026-04-25Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-25 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E9 / R7 (99%) | - |
| Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur, Lucas Rea Published: 2026-04-25Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-25 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E9 / R4 (98%) | - |
| Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings Manas Gaur, Nilanjana Das Published: 2026-04-25Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-04-25 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E8 / R4 (96%) | - |
| ArmSSL: Adversarial Robust Black-Box Watermarking for Self-Supervised Learning Pre-trained Encoders Anmin Fu, Boyu Kuang, Chunyi Zhou, Liquan Chen Published: 2026-04-24Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-24 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E10 / R6 (97%) | - |
| Adversarial Evasion in Non-Stationary Malware Detection: Minimizing Drift Signals through Similarity-Constrained Perturbations Lan Zhang, Pawan Acharya Published: 2026-04-23Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-23 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E9 / R4 (97%) | - |
| Sound Agentic Science Requires Adversarial Experiments Dionizije Fa, Marko Culjak Published: 2026-04-23Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-23 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E6 / R3 (95%) | - |
| Benign Overfitting in Adversarial Training for Vision Transformers Di Wang, Jiaming Zhang, Jingfeng Zhang, Meng Ding Published: 2026-04-21Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-04-21 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E6 / R4 (99%) | - |
| Multi-Gait Learning for Humanoid Robots Using Reinforcement Learning with Selective Adversarial Motion Prior Boyang Xing, Keyi Wang, Linqi Ye, Yuanye Wu Published: 2026-04-21Area: cs.ROCitations: - Tags: adversarial-robustness, ai-safety, csro, preprint | 2026-04-21 | cs.RO | adversarial-robustness, ai-safety, csro, preprint | E10 / R5 (99%) | - |
| Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery Abhinav Agarwal Published: 2026-04-21Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-21 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E8 / R4 (98%) | - |
| Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition Anna Gottardi, Anna Rumshisky, Desheng Zhang, Hangjie Shi Published: 2026-04-20Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-20 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E10 / R8 (98%) | - |
| Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety Daniele Nardi, Federico Pierucci, Federico Sartore, Francesco Giarrusso Published: 2026-04-20Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-04-20 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E11 / R4 (97%) | - |
| Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks Md Rysul Kabir, Zoran Tiganj Published: 2026-04-20Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-20 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E9 / R4 (95%) | - |
| Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks Jin Zhao, Marta Kne啪evi膰, Tanja K盲ser Published: 2026-04-20Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-20 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E9 / R4 (98%) | - |
| How Adversarial Environments Mislead Agentic AI? Hamed Haddadi, Huichi Zhou, Krinos Li, Peiyuan Jing Published: 2026-04-20Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-04-20 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E12 / R6 (98%) | - |
| SafeDream: Safety World Model for Proactive Early Jailbreak Detection Bo Yan, Song Wang, Weikai Lin, Yada Zhu Published: 2026-04-18Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-04-18 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E10 / R5 (99%) | - |
| The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration Jiayuan Liu, Mingyu Guo, Shiyi Du, Vincent Conitzer Published: 2026-04-18Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-04-18 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E6 / R3 (95%) | - |
| Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing Lanjun Wang, Zehao Wang Published: 2026-04-17Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-04-17 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E8 / R5 (100%) | - |
| Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models Emily Curl, Kofi Ampomah, Md Erfan, Sayanton Dibbo Published: 2026-04-16Area: cs.CVCitations: - Tags: adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | 2026-04-16 | cs.CV | adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | E17 / R6 (99%) | - |