Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Multilingual Jailbreak Challenges in Large Language Models Lidong Bing, Sinno Jialin Pan, Wenxuan Zhang, Yue Deng Published: 2023-10-10Area: Adversarial RobustnessCitations: 207 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 207 |
| An Adversarial Example for Direct Logit Attribution: Memory Management in GELU-4L Can Rager, James Dao, Jett Janiak, Yeu-Tong Lau Published: 2023-10-11Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-10-11 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 6 |
| Jailbreaking Black Box Large Language Models in Twenty Queries Alexander Robey, Edgar Dobriban, Eric Wong, George J. Pappas Published: 2023-10-12Area: Adversarial RobustnessCitations: 1175 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1175 |
| Prompt Packer: Deceiving LLMs through Compositional Instruction with Hidden Attacks Rui Tang, Shuyu Jiang, Xingshu Chen Published: 2023-10-16Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 34 |
| Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models? Bo Li, Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin Published: 2023-10-16Area: Adversarial RobustnessCitations: 179 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 179 |
| Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks Erfan Shayegani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh, Pedram Zaree Published: 2023-10-16Area: Surveys & ReviewsCitations: 238 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2023-10-16 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R3 (96%) | 238 |
| Attack Prompt Generation for Red Teaming and Defending Large Language Models Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang Published: 2023-10-19Area: Adversarial RobustnessCitations: 92 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 92 |
| Prompt Injection Attacks and Defenses in LLM-Integrated Applications Jinyuan Jia, Neil Zhenqiang Gong, Runpeng Geng, Yupei Liu Published: 2023-10-19Area: Adversarial RobustnessCitations: 236 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (93%) | 236 |
| Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models Ben Y. Zhao, Haitao Zheng, Josephine Passananti, Shawn Shan Published: 2023-10-20Area: Adversarial RobustnessCitations: 91 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 91 |
| AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models Ani Nenkova, Bang An, Furong Huang, Gang Wu Published: 2023-10-23Area: Adversarial RobustnessCitations: 93 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 93 |
| Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition Anaum Khan, Anson Liu Kost, Chenglei Si, Christopher Carnahan Published: 2023-10-24Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 66 |
| Multi-scale Diffusion Denoised Smoothing Jinwoo Shin, Jongheon Jeong Published: 2023-10-25Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 14 |
| Adversarial Attacks and Defenses in Large Language Models: Old and New Threats David Dobre, Gauthier Gidel, Leo Schwinn, Stephan G眉nnemann Published: 2023-10-30Area: Adversarial RobustnessCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 64 |
| BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B Charlie Rogers-Smith, Jeffrey Ladish, Pranav Gade, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 35 |
| LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B Charlie Rogers-Smith, Jeffrey Ladish, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 152 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 152 |
| Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game Alan Ritter, Ethan Mendes, Isaac Ong, Justin Svegliato Published: 2023-11-02Area: Adversarial RobustnessCitations: 108 Tags: adversarial-robustness, ai-safety, dataset | 2023-11-02 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E6 / R3 (97%) | 108 |
| Can LLMs Follow Simple Rules? Dan Hendrycks, David Karamardian, David Wagner, Lulwa Aljeraisy Published: 2023-11-06Area: Safety EvaluationCitations: 45 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-11-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 45 |
| DeepInception: Hypnotize Large Language Model to Be Jailbreaker Bo Han, Jiangchao Yao, Jianing Zhu, Tongliang Liu Published: 2023-11-06Area: Adversarial RobustnessCitations: 308 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 308 |
| Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation Arush Tagade, Javier Rando, Quentin Feuillade-Montixi, Rusheb Shah Published: 2023-11-06Area: Adversarial RobustnessCitations: 199 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 199 |
| Frontier Language Models are not Robust to Adversarial Arithmetic, or 'What do I need to say so you agree 2+2=5?' Aaron Parisi, Alex Alemi, Alex Rizkowsky, Azade Nova Published: 2023-11-08Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 2 |
| FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts Anyu Wang, Conglei Wang, Delong Ran, Jinyuan Liu Published: 2023-11-09Area: Multimodal SafetyCitations: 306 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2023-11-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | 306 |
| Removing RLHF Protections in GPT-4 via Fine-Tuning Akul Gupta, Daniel Kang, Qiusi Zhan, Richard Fang Published: 2023-11-09Area: Adversarial RobustnessCitations: 150 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 150 |
| Alignment is not sufficient to prevent large language models from generating harmful information: A psychoanalytic perspective Jia Liu, Wei Ding, Zi Yin Published: 2023-11-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3 |
| Backdoor Activation Attack: Attack Large Language Models using Activation Steering for Safety-Alignment Haoran Wang, Kai Shu Published: 2023-11-15Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 24 |
| Debate Helps Supervise Unreliable Experts David Rein, Jackson Petty, Julian Michael, Julien Dirani Published: 2023-11-15Area: Scalable OversightCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2023-11-15 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 31 |
| Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts Lichao Sun, Pan Zhou, Xiang Li, Yixin Liu Published: 2023-11-15Area: Multimodal SafetyCitations: 78 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-11-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 78 |
| Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework Abraham Sanders, Bingsheng Yao, Dakuo Wang, Matthew Pisano Published: 2023-11-16Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (94%) | 33 |
| Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking Bangzheng Li, Ben Zhou, Chaowei Xiao, Fei Wang Published: 2023-11-16Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (95%) | 90 |
| Hijacking Large Language Models via Adversarial In-Context Learning Dongxiao Zhu, Xiangyu Zhou, Yao Qiang Published: 2023-11-16Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 48 |
| JAB: Joint Adversarial Prompting and Belief Augmentation Anil Ramakrishna, Aram Galstyan, Jwala Dhamala, Kai-Wei Chang Published: 2023-11-16Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E6 / R3 (96%) | 8 |