Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips Bo Fang, Jeonghyun Woo, Lishan Yang, Prashant Nair Published: 2024-12-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models Bo Li, Chejian Xu, Mintong Kang Published: 2024-12-11Area: Multimodal SafetyCitations: 24 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (95%) | 24 |
| Antelope: Potent and Concealed Jailbreak Attack Strategy Haoyu Gao, Xiaojun Chen, Xin Zhao Published: 2024-12-11Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |
| AdvPrefix: An Objective for Nuanced LLM Jailbreaks Brandon Amos, Chuan Guo, Ivan Evtimov, Sicheng Zhu Published: 2024-12-13Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 12 |
| No Free Lunch for Defending Against Prefilling Attack by In-Context Learning Bocheng Chen, Guangliang Liu, Kristen Marie Johnson, Ramtin Pedarsani Published: 2024-12-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-12-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Towards Action Hijacking of Large Language Model-based Agent Kangjie Chen, Lina Wang, Run Wang, Xudong Jiang Published: 2024-12-14Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 5 |
| Stepwise Reasoning Error Disruption Attack of LLMs Jingyu Peng, Kai Zhang, Maolin Wang, Pengyue Jia Published: 2024-12-16Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 5 |
| Defending LVLMs Against Vision Attacks through Partial-Perception Supervision Dongxia Wang, Jin Song Dong, Qing Guo, Qi Zhou Published: 2024-12-17Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-17 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 5 |
| Jailbreaking? One Step Is Enough! Aimin Yang, Hongyan Wu, Junhao Chen, Nankai Lin Published: 2024-12-17Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 3 |
| Adversarial Hubness in Multi-Modal Retrieval Collin Zhang, Fnu Suya, Rishi Jha, Tingwei Zhang Published: 2024-12-18Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 6 |
| Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings Sen Su, Wei Zhang, Xiaojun Jia, Xinyue Wang Published: 2024-12-18Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 24 |
| SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage Tianxing He, Wei Xu, Wenbo Hu, Xiaoning Dong Published: 2024-12-19Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 9 |
| Deliberative Alignment: Reasoning Enables Safer Language Models Alec Helyar, Alex Beutel, Amelia Glaese, Andrea Vallone Published: 2024-12-20Area: Alignment TrainingCitations: 210 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-12-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 210 |
| Human-Readable Adversarial Prompts: An Investigation into LLM Vulnerabilities Using Situational Context Edward Raff, Manas Gaur, Nilanjana Das Published: 2024-12-20Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs Chu Wang, Hongyi Li, Jiawei Ye, Jie Wu Published: 2024-12-20Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 5 |
| OpenAI o1 System Card Aaron Jaech, Adam Kalai, Adam Lerer, Ahmed El-Kishky Published: 2024-12-21Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| Large Language Model Safety: A Holistic Survey Bojian Jiang, Chuang Liu, Dan Shi, Deyi Xiong Published: 2024-12-23Area: Surveys & ReviewsCitations: 47 Tags: adversarial-robustness, ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2024-12-23 | Surveys & Reviews | adversarial-robustness, ai-safety, alignment-training, interpretability, survey, surveys-reviews | E7 / R5 (99%) | 47 |
| Retention Score: Quantifying Jailbreak Risks for Vision Language Models Pin-Yu Chen, Tsung-Yi Ho, Zaitang Li Published: 2024-12-23Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (96%) | 1 |
| AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models Jiahao Chen, Qingming Li, Shouling Ji, Xing Yang Published: 2024-12-24Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 5 |
| Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2024-12-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 10 |
| LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models Junfeng Fang, Kun Wang, Miao Yu, Qingsong Wen Published: 2024-12-28Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 8 |
| On the Validity of Traditional Vulnerability Scoring Systems for Adversarial Attacks Against LLMs Ahmad Samer Wazan, Atmane Ayoub Mansour Bahar Published: 2024-12-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-12-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| GASLITEing the Retrieval: Exploring Vulnerabilities in Dense Embedding-based Search Mahmood Sharif, Matan Ben-Tov Published: 2024-12-30Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| Turning Logic Against Itself: Probing Model Defenses Through Contrastive Questions Iryna Gurevych, Rachneet Sachdeva, Rima Hazra Published: 2025-01-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 1 |
| Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency Caixin Kang, Chi Chen, Fengxiang Wang, Hui Xue Published: 2025-01-09Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-09 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | 30 |
| Gandalf the Red: Adaptive Security for LLMs Adri脿 Romero-L贸pez, Alan Commike, Andreas Signer, Athanasios Theocharis Published: 2025-01-14Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 5 |
| Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models Abdulkadir Erol, Agnik Saha, Mehmet E. Aktas, Trilok Padhi Published: 2025-01-14Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 3 |
| Text-Diffusion Red-Teaming of Large Language Models: Unveiling Harmful Behaviors with Proximity Constraints Adish Singla, Goran Radanovi膰, Jonathan N枚ther Published: 2025-01-14Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 1 |
| Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness Bhavya Kailkhura, Brian Bartoldson, Cihang Xie, Zeyu Wang Published: 2025-01-16Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 5 |
| Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-Based Prompt Injection Attacks via the Fine-Tuning Interface Andrey Labunets, Ashish Hooda, Earlence Fernandes, Nishit V. Pandya Published: 2025-01-16Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 9 |