Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation Huaxiu Yao, Jaehong Yoon, Mohit Bansal, Shoubin Yu Published: 2024-10-16Area: Multimodal SafetyCitations: 66 Tags: ai-safety, empirical, multimodal-safety | 2024-10-16 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 66 |
| SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models Aishan Liu, Dacheng Tao, Jinyang Guo, Lei Huang Published: 2024-10-24Area: Multimodal SafetyCitations: 44 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2024-10-24 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 44 |
| BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks Lin Luo, Xiang Zheng, Xingjun Ma, Yige Li Published: 2024-10-28Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | 22 |
| IDEATOR: Jailbreaking Large Vision-Language Models Using Themselves Bo Wang, Ruofan Wang, Xiaosen Wang, Xingjun Ma Published: 2024-10-29Area: Multimodal SafetyCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (99%) | 9 |
| Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector Fengbin Zhu, Jiancheng Lv, Jingkun Tang, Pan Zhou Published: 2024-10-30Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 5 |
| UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models Donghyun Kim, Eric Ma, Gaurav Verma, Megha Sharma Published: 2024-11-03Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 14 |
| Unfair Alignment: Examining Safety Alignment Across Vision Encoder Layers in Vision-Language Models Amit K. Roy-Chowdhury, Arindam Dutta, Chengyu Song, Erfan Shayegani Published: 2024-11-06Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-06 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 2 |
| The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense Fangkai Jiao, Liqiang Nie, Mohan Kankanhalli, Yangyang Guo Published: 2024-11-13Area: Multimodal SafetyCitations: 19 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 19 |
| Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey Huaibo Huang, Miaoxuan Zhang, Peipei Li, Ran He Published: 2024-11-14Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2024-11-14 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E5 / R4 (96%) | 25 |
| Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations Eric Smith, Hongyuan Zhan, Javier Rando, Jianfeng Chi Published: 2024-11-15Area: Multimodal SafetyCitations: 93 Tags: ai-safety, empirical, multimodal-safety | 2024-11-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 93 |
| SoK: Unifying Cybersecurity and Cybersafety of Multimodal Foundation Models with an Information Theory Approach Bo Li, Chaowei Xiao, Hammond Pearce, Jiamin Chang Published: 2024-11-17Area: Multimodal SafetyCitations: - Tags: ai-safety, multimodal-safety, survey | 2024-11-17 | Multimodal Safety | ai-safety, multimodal-safety, survey | E4 / R3 (94%) | - |
| Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-11-18Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens Beier Zhu, Junkai Chen, Tingjin Luo, Xu Yang Published: 2024-11-23Area: Multimodal SafetyCitations: 65 Tags: ai-safety, empirical, multimodal-safety | 2024-11-23 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 65 |
| Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks Gang Wang, Han Wang, Huan Zhang Published: 2024-11-23Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 25 |
| Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks Hao Chen, Jianda Mao, Kani Chen, Peng Xie Published: 2024-11-24Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 14 |
| In-Context Experience Replay Facilitates Safety Red-Teaming of Text-to-Image Diffusion Models Kuan-Chen Mu, Mario Fritz, Pin-Yu Chen, Wei-Chen Chiu Published: 2024-11-25Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (96%) | 2 |
| Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models Bryan Hooi, Jun Liu, Kai-Wei Chang, Shuyang Hao Published: 2024-11-27Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 6 |
| Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment Ahmad Beirami, Alvaro Velasquez, Amrit Singh Bedi, Dinesh Manocha Published: 2024-11-27Area: Multimodal SafetyCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 18 |
| Jailbreak Large Vision-Language Models Through Multi-Modal Linkage Geyuan Zhang, Tianxing He, Xiaofei Zhou, Yichen Wang Published: 2024-11-30Area: Multimodal SafetyCitations: 37 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 37 |
| Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization Charles Fleming, Gaowen Liu, Jiangweizhi Peng, Mingyi Hong Published: 2024-12-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, empirical, multimodal-safety | 2024-12-05 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 4 |
| Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models Chu Zhixuan, Duan Ranjie, Huang Yihao, Jia Xiaojun Published: 2024-12-08Area: Multimodal SafetyCitations: 21 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 21 |
| SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations Bo Li, Francesco Pinto, Minzhou Pan, Zhaorun Chen Published: 2024-12-09Area: Multimodal SafetyCitations: 22 Tags: ai-safety, empirical, multimodal-safety | 2024-12-09 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 22 |
| AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models Bo Li, Chejian Xu, Mintong Kang Published: 2024-12-11Area: Multimodal SafetyCitations: 24 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (95%) | 24 |
| AlignGuard: Scalable Safety Alignment for Text-to-Image Generation Ashkan Khakzar, Fabio Pizzati, I Chieh Chen, Jindong Gu Published: 2024-12-13Area: Multimodal SafetyCitations: 11 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-12-13 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (98%) | 11 |
| Defending LVLMs Against Vision Attacks through Partial-Perception Supervision Dongxia Wang, Jin Song Dong, Qing Guo, Qi Zhou Published: 2024-12-17Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-17 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 5 |
| Retention Score: Quantifying Jailbreak Risks for Vision Language Models Pin-Yu Chen, Tsung-Yi Ho, Zaitang Li Published: 2024-12-23Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (96%) | 1 |
| PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models Bo Li, Chejian Xu, Guanhong Tao, Lingzhi Yuan Published: 2025-01-07Area: Multimodal SafetyCitations: 12 Tags: ai-safety, empirical, multimodal-safety | 2025-01-07 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 12 |
| Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency Caixin Kang, Chi Chen, Fengxiang Wang, Hui Xue Published: 2025-01-09Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-09 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | 30 |
| Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models Abdulkadir Erol, Agnik Saha, Mehmet E. Aktas, Trilok Padhi Published: 2025-01-14Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 3 |
| Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness Bhavya Kailkhura, Brian Bartoldson, Cihang Xie, Zeyu Wang Published: 2025-01-16Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 5 |