Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Multimodal Safety Is Asymmetric: Cross-Modal Exploits Unlock Black-Box MLLMs Jailbreaks Ao Liu, Beibei Li, Shouling Ji, Xinkai Wang Published: 2025-10-20Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 1 |
| PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits Diptanshu Purwar, Madhav Aggarwal, Neeladri Bhuiya Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs Masahiro Kaneko, Timothy Baldwin Published: 2025-10-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| Black-box Optimization of LLM Outputs by Asking for Directions Florian Tram猫r, Jie Zhang, Jue Hong, Meng Ding Published: 2025-10-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (97%) | 2 |
| BreakFun: Jailbreaking LLMs via Schema Exploitation Amirkia Rafiei Oskooei, Mehmet S. Aktas Published: 2025-10-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning Bingqi Shang, Bingquan Shen, Sijia Liu, Yihua Zhang Published: 2025-10-19Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization Masahiro Kaneko, Timothy Baldwin, Zeerak Talat Published: 2025-10-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 2 |
| Detecting Adversarial Fine-tuning with Auditing Agents John Schulman, Nicholas Carlini, Sarah Egler Published: 2025-10-17Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |
| HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment Jing Shao, Lijun Li, Xingjun Wang, Yuexiao Liu Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models Ali Arastehfard, Biying Liu, Hanbin Hong, Heqing Huang Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R4 (97%) | 1 |
| A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space Bernard Ghanem, Bingjie Zhang, Dandan Guo, Jindong Gu Published: 2025-10-16Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers Andrew Zhao, Emily Lawton, Gao Huang, Jack W. Stokes Published: 2025-10-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Qwen3Guard Technical Report An Yang, Baosong Yang, Bowen Yu, Chen Cheng Published: 2025-10-16Area: Adversarial RobustnessCitations: 37 Tags: adversarial-robustness, ai-safety, tool | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (99%) | 37 |
| Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling Deyue Zhang, Dongdong Yang, Junjie Mu, Quancheng Zou Published: 2025-10-16Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 1 |
| PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features Jinyuan Jia, Neil Gong, Wei Zou, Yanting Wang Published: 2025-10-15Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| SHIELD: Classifier-Guided Prompting for Robust and Safer LVLMs Juan Ren, Mark Dras, Usman Naseem Published: 2025-10-15Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 4 |
| Breaking Guardrails, Facing Walls: Insights on Adversarial AI for Defenders & Researchers Giacomo Bertollo, Jonah Burgess, Naz Bodemir Published: 2025-10-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (96%) | - |
| Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection Daniele Nardi, Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani Published: 2025-10-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 2 |
| RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs Heath Cooper, John Le, Thai T. Vu, Tuan T. Nguyen Published: 2025-10-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (96%) | - |
| SafeMT: Multi-turn Safety for Multimodal Language Models Boyuan Chen, Chengkun Cai, Chi-Min Chan, Han Zhu Published: 2025-10-14Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-10-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | 3 |
| Adversarial Attacks Leverage Interference Between Features in Superposition Edward Stevinson, Lucas Prieto, Melih Barsbey, Tolga Birdal Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Bag of Tricks for Subverting Reasoning-based Safety Guardrails Bailan He, Haokun Chen, Jindong Gu, Jingpei Wu Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 1 |
| CoSPED: Consistent Soft Prompt Targeted Data Extraction and Defense Fok Kar Wai, Vrizlynn Thing, Yang Zhuochen Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (97%) | - |
| Deep Research Brings Deeper Harm Bailan He, Georg Groh, Haokun Chen, Jindong Gu Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Don't Walk the Line: Boundary Guidance for Filtered Generation Andreas Haupt, Sarah Ball Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity Adji Bousso Dieng, Alex John London, Alvaro Velasquez, Amrit Singh Bedi Published: 2025-10-13Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 2 |
| RAG-Pull: Imperceptible Attacks on RAG Systems for Code Generation Aritra Dhar, Lukas Cavigelli, Vasilije Stambolic Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts Olamide Jogunola, Oluwaseun Ajao, Tiarnaigh Downey-Webb Published: 2025-10-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | - |
| ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test Farn Wang, Guan-Yan Yang, Kuo-Hui Yeh, Tzu-Yu Cheng Published: 2025-10-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| Text Prompt Injection of Vision Language Models Ruizhe Zhu Published: 2025-10-10Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 2 |