Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models Jiaxu Liu, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2025-03-08 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E5 / R4 (96%) | - |
| RedDiffuser: Red Teaming Vision-Language Models for Toxic Continuation via Reinforced Stable Diffusion Cong Wang, Ruofan Wang, Xiang Zheng, Xiaosen Wang Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety, red-teaming | 2025-03-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety, red-teaming | E6 / R3 (96%) | - |
| E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models Aishan Liu, Haotian Zhu, Liming Lu, Shuchao Pang Published: 2025-03-05Area: Multimodal SafetyCitations: 16 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 16 |
| FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts Jihui Guo, Xinlei He, Zhen Sun, Ziyi Zhang Published: 2025-02-28Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 5 |
| Unified Prompt Attack Against Text-to-Image Generation Models Duo Peng, Jun Liu, Mark He Huang, Ping Hu Published: 2025-02-23Area: Multimodal SafetyCitations: 4 Tags: ai-safety, empirical, multimodal-safety | 2025-02-23 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R5 (97%) | 4 |
| EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models Devashri Naik, Dinithi Jayasuriya, Nastaran Darabi, Ranganath Krishnan Published: 2025-02-20Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 2 |
| HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States Bo Zheng, Tianshuo Peng, Xiangyu Yue, Xiaoyong Zhu Published: 2025-02-20Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 22 |
| SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning Jia Liu, Junkai Chen, Kening Zheng, Peijie Jiang Published: 2025-02-18Area: Multimodal SafetyCitations: 20 Tags: ai-safety, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 20 |
| SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings Cen Chen, Hao Peng, Huiping Zhuang, Shien-Ming Wu Published: 2025-02-18Area: Multimodal SafetyCitations: 5 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Understanding and Rectifying Safety Perception Distortion in VLMs George Kesidis, Jian Kang, Lu Lin, Xiaohan Zou Published: 2025-02-18Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 5 |
| Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang Published: 2025-02-17Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Distraction is All You Need for Multimodal Large Language Model Jailbreaking Anli Yan, Changyu Dong, Erdun Gao, Jiluan Fan Published: 2025-02-15Area: Multimodal SafetyCitations: 23 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 23 |
| A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations Bo Du, Dacheng Tao, Mang Ye, Nenghai Yu Published: 2025-02-14Area: Multimodal SafetyCitations: 47 Tags: ai-safety, multimodal-safety, safety-evaluation, survey | 2025-02-14 | Multimodal Safety | ai-safety, multimodal-safety, safety-evaluation, survey | E5 / R3 (95%) | 47 |
| VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap Chaowei Xiao, Fei Wang, Muhao Chen, Qin Liu Published: 2025-02-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 7 |
| Universal Adversarial Attack on Aligned Multimodal LLMs Andrey Kuznetsov, Anton Razzhigaev, Matvey Mikhalchuk, Polina Druzhinina Published: 2025-02-11Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images Adam Dziedzic, Aditya Kumar, Franziska Boenisch, Tom Blanchard Published: 2025-02-07Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E5 / R3 (94%) | - |
| ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Ashkan Yousefpour, Bumsub Ham, Doehyeon Lee, Eugene Choi Published: 2025-02-07Area: Multimodal SafetyCitations: 5 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 5 |
| The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering Di Liu, Dimitris N. Metaxas, Haizhou Shi, Hao Wang Published: 2025-02-05Area: Multimodal SafetyCitations: 26 Tags: ai-safety, empirical, multimodal-safety | 2025-02-05 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 26 |
| Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models Fahad Khan, Fahad Shamshad, Hashmat Shadab Malik, Karthik Nandakumar Published: 2025-02-03Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (94%) | 8 |
| Towards Robust Multimodal Large Language Models Against Jailbreak Attacks Fenglong Ma, Han Liu, Jinghui Chen, Ting Wang Published: 2025-02-02Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 2 |
| Concept Steerers: Leveraging K-Sparse Autoencoders for Controllable Generations Dahye Kim, Deepti Ghadiyaram Published: 2025-01-31Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-01-31 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models Bing Cao, Jing Shao, Lijun Li, Yi Ding Published: 2025-01-30Area: Multimodal SafetyCitations: 15 Tags: ai-safety, empirical, multimodal-safety | 2025-01-30 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 15 |
| Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink Chenyue Wang, Hui Xue, Jialing Tao, Jiexi Liu Published: 2025-01-25Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 7 |
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |
| Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness Bhavya Kailkhura, Brian Bartoldson, Cihang Xie, Zeyu Wang Published: 2025-01-16Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 5 |
| Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models Abdulkadir Erol, Agnik Saha, Mehmet E. Aktas, Trilok Padhi Published: 2025-01-14Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 3 |
| Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency Caixin Kang, Chi Chen, Fengxiang Wang, Hui Xue Published: 2025-01-09Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-09 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | 30 |
| PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models Bo Li, Chejian Xu, Guanhong Tao, Lingzhi Yuan Published: 2025-01-07Area: Multimodal SafetyCitations: 12 Tags: ai-safety, empirical, multimodal-safety | 2025-01-07 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 12 |
| Retention Score: Quantifying Jailbreak Risks for Vision Language Models Pin-Yu Chen, Tsung-Yi Ho, Zaitang Li Published: 2024-12-23Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (96%) | 1 |
| Defending LVLMs Against Vision Attacks through Partial-Perception Supervision Dongxia Wang, Jin Song Dong, Qing Guo, Qi Zhou Published: 2024-12-17Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-17 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 5 |