Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |
| Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink Chenyue Wang, Hui Xue, Jialing Tao, Jiexi Liu Published: 2025-01-25Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 7 |
| Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models Bing Cao, Jing Shao, Lijun Li, Yi Ding Published: 2025-01-30Area: Multimodal SafetyCitations: 15 Tags: ai-safety, empirical, multimodal-safety | 2025-01-30 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 15 |
| Concept Steerers: Leveraging K-Sparse Autoencoders for Controllable Generations Dahye Kim, Deepti Ghadiyaram Published: 2025-01-31Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-01-31 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Towards Robust Multimodal Large Language Models Against Jailbreak Attacks Fenglong Ma, Han Liu, Jinghui Chen, Ting Wang Published: 2025-02-02Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 2 |
| Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models Fahad Khan, Fahad Shamshad, Hashmat Shadab Malik, Karthik Nandakumar Published: 2025-02-03Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (94%) | 8 |
| The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering Di Liu, Dimitris N. Metaxas, Haizhou Shi, Hao Wang Published: 2025-02-05Area: Multimodal SafetyCitations: 26 Tags: ai-safety, empirical, multimodal-safety | 2025-02-05 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 26 |
| Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images Adam Dziedzic, Aditya Kumar, Franziska Boenisch, Tom Blanchard Published: 2025-02-07Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E5 / R3 (94%) | - |
| ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Ashkan Yousefpour, Bumsub Ham, Doehyeon Lee, Eugene Choi Published: 2025-02-07Area: Multimodal SafetyCitations: 5 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 5 |
| Universal Adversarial Attack on Aligned Multimodal LLMs Andrey Kuznetsov, Anton Razzhigaev, Matvey Mikhalchuk, Polina Druzhinina Published: 2025-02-11Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations Bo Du, Dacheng Tao, Mang Ye, Nenghai Yu Published: 2025-02-14Area: Multimodal SafetyCitations: 47 Tags: ai-safety, multimodal-safety, safety-evaluation, survey | 2025-02-14 | Multimodal Safety | ai-safety, multimodal-safety, safety-evaluation, survey | E5 / R3 (95%) | 47 |
| VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap Chaowei Xiao, Fei Wang, Muhao Chen, Qin Liu Published: 2025-02-14Area: Multimodal SafetyCitations: 7 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-14 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 7 |
| Distraction is All You Need for Multimodal Large Language Model Jailbreaking Anli Yan, Changyu Dong, Erdun Gao, Jiluan Fan Published: 2025-02-15Area: Multimodal SafetyCitations: 23 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 23 |
| Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang Published: 2025-02-17Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning Jia Liu, Junkai Chen, Kening Zheng, Peijie Jiang Published: 2025-02-18Area: Multimodal SafetyCitations: 20 Tags: ai-safety, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 20 |
| SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings Cen Chen, Hao Peng, Huiping Zhuang, Shien-Ming Wu Published: 2025-02-18Area: Multimodal SafetyCitations: 5 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Understanding and Rectifying Safety Perception Distortion in VLMs George Kesidis, Jian Kang, Lu Lin, Xiaohan Zou Published: 2025-02-18Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2025-02-18 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 5 |
| EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models Devashri Naik, Dinithi Jayasuriya, Nastaran Darabi, Ranganath Krishnan Published: 2025-02-20Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 2 |
| HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States Bo Zheng, Tianshuo Peng, Xiangyu Yue, Xiaoyong Zhu Published: 2025-02-20Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 22 |
| Unified Prompt Attack Against Text-to-Image Generation Models Duo Peng, Jun Liu, Mark He Huang, Ping Hu Published: 2025-02-23Area: Multimodal SafetyCitations: 4 Tags: ai-safety, empirical, multimodal-safety | 2025-02-23 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R5 (97%) | 4 |
| FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts Jihui Guo, Xinlei He, Zhen Sun, Ziyi Zhang Published: 2025-02-28Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 5 |
| E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models Aishan Liu, Haotian Zhu, Liming Lu, Shuchao Pang Published: 2025-03-05Area: Multimodal SafetyCitations: 16 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 16 |
| CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models Jiaxu Liu, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2025-03-08 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E5 / R4 (96%) | - |
| RedDiffuser: Red Teaming Vision-Language Models for Toxic Continuation via Reinforced Stable Diffusion Cong Wang, Ruofan Wang, Xiang Zheng, Xiaosen Wang Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety, red-teaming | 2025-03-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety, red-teaming | E6 / R3 (96%) | - |
| Utilizing Jailbreak Probability to Attack and Safeguard Multimodal LLMs Deyue Zhang, Dongdong Yang, Quanchen Zou, Wenzhuo Xu Published: 2025-03-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (95%) | - |
| ExtremeAIGC: Benchmarking LMM Vulnerability to AI-Generated Extremist Content Bhavik Chandna, Mariam Aboujenane, Usman Naseem Published: 2025-03-13Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E6 / R3 (95%) | 1 |
| MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents Adel Bibi, Alasdair Paren, Lukas Aichberger, Philip Torr Published: 2025-03-13Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (98%) | 8 |
| TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models Jinwei Hu, Wenjie Ruan, Xiangyu Yin, Xiaowei Huang Published: 2025-03-13Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (95%) | 2 |
| TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention Bhavya Kailkhura, Fei Kong, Hao Cheng, James Diffenderfer Published: 2025-03-13Area: Multimodal SafetyCitations: 9 Tags: ai-safety, empirical, multimodal-safety | 2025-03-13 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 9 |
| Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization Bryan Hooi, Jun Liu, Muhao Chen, Shuyang Hao Published: 2025-03-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (96%) | 1 |