Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-tuning Bingquan Shen, Gaowen Liu, Sijia Liu, Yihua Zhang Published: 2025-03-14Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 7 |
| Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense Bryan Hooi, Chengcheng Tang, Jun Liu, Ming-Hsuan Yang Published: 2025-03-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning Yanjun Qi, Zhe Wang Published: 2025-03-16Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 4 |
| Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attack Murong Yue, Ziyu Yao Published: 2025-03-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-03-18 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| Survey of Adversarial Robustness in Multimodal Large Language Models Chengze Jiang, Jie Gui, Minjing Dong, Zhuangzhuang Wang Published: 2025-03-18Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2025-03-18 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E5 / R3 (95%) | 11 |
| Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings Aishan Liu, Dacheng Tao, Deyue Zhang, Guangyi Zheng Published: 2025-03-19Area: Safety EvaluationCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-03-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 28 |
| STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models Daoyuan Wu, Pingchuan Ma, Shuai Wang, Wenxuan Wang Published: 2025-03-23Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 5 |
| MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks Bryan Hooi, Ming-Hsuan Yang, Wenhao You, Yiwei Wang Published: 2025-03-24Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 4 |
| Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy Eunho Yang, Jaeryong Hwang, Joonhyun Jeong, Seyun Bae Published: 2025-03-26Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Data Poisoning in Deep Learning: A Survey Di Gao, Ou Wu, Pengfei Jiao, Pinlong Zhao Published: 2025-03-27Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, survey | 2025-03-27 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (95%) | 15 |
| Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models Fan Zhou, Hongtu Zhu, Runpeng Dai, Run Yang Published: 2025-03-28Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 5 |
| Beyond Prompts: Space-Time Decoupling Control-Plane Jailbreaks in LLM Structured Output Huimin Cui, Jiacheng Zhao, Ruiyuan Xu, Shuoming Zhang Published: 2025-03-31Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 8 |
| ShieldGemma 2: Robust and Tractable Image Content Moderation Aparna Joshi, Cai Xu, Dana Kurniawan, Dirichi Ike-Njoku Published: 2025-04-01Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 11 |
| The Illusionist's Prompt: Exposing the Factual Vulnerabilities of Large Language Models with Linguistic Nuances Geng Hong, Min Yang, Mi Zhang, Xi Li Published: 2025-04-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 1 |
| AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization Chaohu Liu, Linli Xu, Tianyi Gui, Yu Liu Published: 2025-04-02Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (94%) | 3 |
| Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses Wenlan Wei, Zhengchun Shang Published: 2025-04-02Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E10 / R3 (97%) | 7 |
| PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization Aofan Liu, Ao Yang, Bin Wang, Lulu Tang Published: 2025-04-02Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 5 |
| Representation Bending for Large Language Model Safety Alvin Wan, Ashkan Yousefpour, Harrison Ngan, Jonghyun Choi Published: 2025-04-02Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 14 |
| Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks Jiawei Wang, Kin-Man Lam, Yicheng Fu, Yichun Feng Published: 2025-04-02Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning Ninareh Mehrabi, Rahul Gupta, Ruoxi Jia, Si Chen Published: 2025-04-02Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 9 |
| JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model Chaowei Xiao, Li Li, Shenzhe Zhu, Yi Nian Published: 2025-04-03Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (95%) | - |
| More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment Ananth Grama, Bolian Li, David Cho, Junyuan Hong Published: 2025-04-03Area: Alignment TrainingCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-03 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 5 |
| The H-Elena Trojan Virus to Infect Model Weights: A Wake-Up Call on the Security Risks of Malicious Fine-Tuning Andrés Herrera-Poyatos, Carlos Peláez-González, Cristina Zuheros, David Herrera-Poyatos Published: 2025-04-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-04-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| A Domain-Based Taxonomy of Jailbreak Vulnerabilities in Large Language Models Andrés Herrera-Poyatos, Carlos Peláez-González, Cristina Zuheros, David Herrera-Poyatos Published: 2025-04-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, survey | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, survey | E6 / R4 (96%) | 1 |
| On the Robustness of GUI Grounding Models Against Image Attacks Haoren Zhao, Tianyi Chen, Zhen Wang Published: 2025-04-07Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | 7 |
| Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models Jianhong Pan, Jiawei Lian, Lap-Pui Chau, Lefan Wang Published: 2025-04-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Adversarial Training of Reward Models Adithya Renduchintala, Alexander Bukharin, Haifeng Qian, Oleksii Kuchaiev Published: 2025-04-08Area: Alignment TrainingCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking Junhao Dong, Junxi Chen, Xiaohua Xie Published: 2025-04-08Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 5 |
| ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs Athanasios V. Vasilakos, Gejian Zhao, Hanzhou Wu, Xinpeng Zhang Published: 2025-04-08Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 12 |
| Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking Jie Zhang, Yu-Hang Wu, Yu-Jie Xiong Published: 2025-04-08Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (93%) | 3 |