Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security Hao Sun, Junyu Gao, Muzhi Dai, Shixuan Liu Published: 2025-07-29Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (96%) | 4 |
| Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models Han Zheng, Mingang Chen, Wanying Wang, Xin Tan Published: 2025-07-29Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | - |
| Customize Multi-modal RAI Guardrails with Precedent-based predictions Cheng-Fu Yang, Christos Christodoulopoulos, Kai-Wei Chang, Rahul Gupta Published: 2025-07-28Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-07-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-07-18Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-18 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities Michael Backes, Yang Zhang, Yiting Qu Published: 2025-07-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-15 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (98%) | 1 |
| Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World Lun Wang, Rajiv Mathews, Soheil Feizi, Vinu Sankar Sadasivan Published: 2025-07-07Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message Li Qian, Wei Duan Published: 2025-07-07Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E4 / R3 (95%) | - |
| SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism Beitao Chen, Heng Tao Shen, Jingkuan Song, Lianli Gao Published: 2025-07-02Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (98%) | 3 |
| On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling Anna Yoo Jeong Ha, Ben Y. Zhao, Haitao Zheng, Ronik Bhaskar Published: 2025-06-27Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-27 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models Lei Jiang, Liangli Zhen, Xiaobing Sun, Xiaohua Xu Published: 2025-06-20Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R2 (96%) | 2 |
| The Safety Reminder: A Soft Prompt to Reactivate Delayed Safety Awareness in Vision-Language Models Haojie Xin, Jun Sun, Peiyuan Tang, Qin Xia Published: 2025-06-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-06-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025 Aishan Liu, Alan Yuille, Changting Lin, Dacheng Tao Published: 2025-06-14Area: Multimodal SafetyCitations: 10 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R4 (97%) | 10 |
| QGuard: Question-based Zero-shot Guard for Multi-modal LLM Safety Hyoungseo Cho, Jeonghwa Yoo, Soo Yong Kim, Taegyeong Lee Published: 2025-06-14Area: Multimodal SafetyCitations: 2 Tags: ai-safety, empirical, multimodal-safety | 2025-06-14 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 2 |
| Understanding and Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding Hang Su, Jun Zhu, Meng Wang, Richang Hong Published: 2025-06-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (97%) | 1 |
| DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt Ge Li, Jia Li, Liyi Cai, Yitong Zhang Published: 2025-06-11Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (96%) | 3 |
| GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models Bo Wang, Xiang Zheng, Xiaosen Wang, Xingjun Ma Published: 2025-06-11Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (95%) | 2 |
| Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations Ramtin Pedarsani, Reza Abbasi-Asl, Zhiyu Xue Published: 2025-06-08Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 1 |
| HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model Ilcahe Jung, Kangsan Kim, Kwanyong Park, Seanie Lee Published: 2025-06-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, benchmark, interpretability, multimodal-safety | 2025-06-05 | Multimodal Safety | ai-safety, benchmark, interpretability, multimodal-safety | E4 / R3 (98%) | 4 |
| DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models Anders Holst, Jia Fu, Kunyu Peng, Sepideh Pashami Published: 2025-06-04Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 2 |
| Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities Iryna Gurevych, Jiahui Geng, Preslav Nakov, Thy Thy Tran Published: 2025-05-31Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 2 |
| Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap Ali Payani, Baharan Mirzasoleiman, Spencer Stice, Wenhan Yang Published: 2025-05-30Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-05-30 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 1 |
| Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment Bo Li, Chao Du, Sensen Gao, Simeng Qin Published: 2025-05-27Area: Multimodal SafetyCitations: 20 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 20 |
| Attention! Your Vision Language Model Could Be Maliciously Manipulated Shaokang Wang, Shudong Zhang, Xiaosen Wang, Yuyang Luo Published: 2025-05-26Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 3 |
| Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts Changick Kim, Hee-Seon Kim, Kihyun Kim, Minbeom Kim Published: 2025-05-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | - |
| JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models Jiaxin Song, Jie Li, Rui Yu, Xingjun Ma Published: 2025-05-26Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (97%) | 3 |
| JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models Jingyi Zheng, Mingchen Li, Shengmin Xu, Wenhan Dong Published: 2025-05-23Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-05-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (99%) | 6 |
| Backdoor Cleaning without External Guidance in MLLM Fine-tuning Bo Du, Jian Liang, Jinhe Bi, Mang Ye Published: 2025-05-22Area: Multimodal SafetyCitations: 14 Tags: ai-safety, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 14 |
| Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models Dongsheng Shi, Gerard de Melo, Linlin Wang, Xiaoling Wang Published: 2025-05-22Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R2 (95%) | 1 |
| Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models Cong Tian, Handing Wang, Yaochu Jin, Zhaoxin Wang Published: 2025-05-22Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (97%) | 4 |
| Robustifying Vision-Language Models via Dynamic Token Reweighting Fenglong Ma, Jiacheng Liang, Jiawei Zhou, Rongyi Zhu Published: 2025-05-22Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 2 |