Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Data Poisoning for In-context Learning Han Xu, Hui Liu, Jiliang Tang, Makoto Yamada Published: 2024-02-03Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 27 |
| Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models Ondrej Bohdal, Timothy Hospedales, Tingyang Yu, Yongshuo Zong Published: 2024-02-03Area: Multimodal SafetyCitations: 125 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 125 |
| Jailbreaking Attack against Multimodal Large Language Model Gang Hua, Haodong Ren, Rong Jin, Xinbo Gao Published: 2024-02-04Area: Multimodal SafetyCitations: 128 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R3 (95%) | 128 |
| GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models Andy Zhou, Haibo Jin, Haohan Wang, Peiyan Zhang Published: 2024-02-05Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R3 (97%) | 49 |
| HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Andy Zou, Bo Li, Dan Hendrycks, David Forsyth Published: 2024-02-06Area: Safety EvaluationCitations: 830 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-02-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (95%) | 830 |
| Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications Boyi Wei, Kaixuan Huang, Mengdi Wang, Mengzhou Xia Published: 2024-02-07Area: Adversarial RobustnessCitations: 188 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 188 |
| Comprehensive Assessment of Jailbreak Attacks Against LLMs Junjie Chu, Michael Backes, Xinyue Shen, Yang Zhang Published: 2024-02-08Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R4 (99%) | 90 |
| Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia Guangyu Shen, Guanhong Tao, Kaiyuan Zhang, Lu Yan Published: 2024-02-08Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 18 |
| StruQ: Defending Against Prompt Injection with Structured Queries Chawin Sitawarin, David Wagner, Julien Piet, Sizhe Chen Published: 2024-02-09Area: Adversarial RobustnessCitations: 185 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 185 |
| Whispers in the Machine: Confidentiality in LLM-integrated Systems Jonathan Evertz, Lea Sch枚nherr, Merlin Chlosta, Thorsten Eisenhofer Published: 2024-02-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models Binghui Wang, Jinyuan Jia, Runpeng Geng, Wei Zou Published: 2024-02-12Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 111 |
| Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 106 |
| COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability Bin Hu, Fangxu Yu, Huan Zhang, Lianhui Qin Published: 2024-02-13Area: Adversarial RobustnessCitations: 157 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 157 |
| Test-Time Backdoor Attacks on Multimodal Large Language Models Chao Du, Dong Lu, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 39 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (98%) | 39 |
| Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation Alicia Parrish, Charvi Rastogi, Erin van Liemt, Hannah Rose Kirk Published: 2024-02-14Area: Safety EvaluationCitations: 19 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-14 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 19 |
| Attacking Large Language Models with Projected Gradient Descent Johannes Gasteiger, M. H. I. Abdalla, Simon Geisler, Stephan G眉nnemann Published: 2024-02-14Area: Adversarial RobustnessCitations: 105 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 105 |
| Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks Grigorios G. Chrysos, Markos Georgopoulos, Volkan Cevher, Yixin Cheng Published: 2024-02-14Area: Adversarial RobustnessCitations: 25 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 25 |
| SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding Bill Yuchen Lin, Fengqing Jiang, Jinyuan Jia, Luyao Niu Published: 2024-02-14Area: Adversarial RobustnessCitations: 217 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 217 |
| Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space David Dobre, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-02-14Area: Adversarial RobustnessCitations: 83 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 83 |
| A StrongREJECT for Empty Jailbreaks Alexandra Souly, Dillon Bowen, Elvis Hsieh, Justin Svegliato Published: 2024-02-15Area: Safety EvaluationCitations: 217 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-15 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 217 |
| A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents Boyuan Zheng, Chaowei Xiao, Huan Sun, Lingbo Mo Published: 2024-02-15Area: Agent SafetyCitations: 23 Tags: adversarial-robustness, agent-safety, ai-safety, survey | 2024-02-15 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, survey | E6 / R4 (97%) | 23 |
| PAL: Proxy-Guided Black-Box Attack on Large Language Models Alexandre Araujo, Chawin Sitawarin, David Wagner, Norman Mu Published: 2024-02-15Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 50 |
| Recovering the Pre-Fine-Tuning Weights of Generative Models Eliahu Horwitz, Jonathan Kahana, Yedid Hoshen Published: 2024-02-15Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |
| When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers Advait Chirmule, Bimal Gajera, Chitta Baral, Divij Handa Published: 2024-02-16Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 33 |
| ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Luyao Niu Published: 2024-02-19Area: Adversarial RobustnessCitations: 215 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 215 |
| Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! Chao Yang, Jiaheng Liu, Jie Liu, Wanli Ouyang Published: 2024-02-19Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 35 |
| Query-Based Adversarial Prompt Generation Ema Borevkovic, Florian Tram猫r, Jonathan Hayase, Milad Nasr Published: 2024-02-19Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 48 |
| Defending Jailbreak Prompts via In-Context Adversarial Game Haomin Zhuang, Hongyan Bao, Kehan Guo, Taicheng Guo Published: 2024-02-20Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 32 |
| Generative AI Security: Challenges and Countermeasures Banghua Zhu, David Wagner, Jiantao Jiao, Norman Mu Published: 2024-02-20Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, survey | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 14 |
| Is the System Message Really Important to Jailbreaks in Large Language Models? Ke Li, Xiaotian Zou, Yongkang Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 24 |