Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Circumventing Concept Erasure Methods For Text-to-Image Generative Models Chinmay Hegde, Govind Mittal, Kelly O. Marshall, Minh Pham Published: 2023-08-03Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 73 |
| "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models Michael Backes, Xinyue Shen, Yang Zhang, Yun Shen Published: 2023-08-07Area: Adversarial RobustnessCitations: 497 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (97%) | 497 |
| FLIRT: Feedback Loop In-context Red Teaming Aram Galstyan, Christophe Dupuy, Kai-Wei Chang, Ninareh Mehrabi Published: 2023-08-08Area: Safety EvaluationCitations: 93 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-08-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 93 |
| GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher Jen-tse Huang, Pinjia He, Shuming Shi, Wenxiang Jiao Published: 2023-08-12Area: Adversarial RobustnessCitations: 408 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-08-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 408 |
| Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models Michael Backes, Tianshuo Cong, Yang Zhang, Yugeng Liu Published: 2023-08-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 11 |
| Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment Rishabh Bhardwaj, Soujanya Poria Published: 2023-08-18Area: Safety EvaluationCitations: 229 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2023-08-18 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 229 |
| Adversarial Illusions in Multi-Modal Embeddings Eugene Bagdasaryan, Rishi Jha, Tingwei Zhang, Vitaly Shmatikov Published: 2023-08-22Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-08-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 30 |
| Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities Bennett Kleinberg, Lewis D. Griffin, Maximilian Mozes, Xuanli He Published: 2023-08-24Area: Safety EvaluationCitations: 113 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | 2023-08-24 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | E5 / R4 (95%) | 113 |
| Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content Charles O'Neill, Ioana Ciuc膬, Jack Miller, Thang Bui Published: 2023-08-26Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 10 |
| Detecting Language Model Attacks with Perplexity Gabriel Alon, Michael Kamfonas Published: 2023-08-27Area: Adversarial RobustnessCitations: 392 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 392 |
| Baseline Defenses for Adversarial Attacks Against Aligned Language Models Aniruddha Saha, Avi Schwarzschild, Gowthami Somepalli, John Kirchenbauer Published: 2023-09-01Area: Adversarial RobustnessCitations: 612 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 612 |
| Image Hijacks: Adversarial Images can Control Generative Models at Runtime Euan Ong, Luke Bailey, Scott Emmons, Stuart Russell Published: 2023-09-01Area: Multimodal SafetyCitations: 146 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (99%) | 146 |
| Open Sesame! Universal Black Box Jailbreaking of Large Language Models Moshe Sipper, Raz Lapid, Ron Langberg Published: 2023-09-04Area: Adversarial RobustnessCitations: 155 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 155 |
| Certifying LLM Safety against Adversarial Prompting Aaron Jiaxun Li, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju Published: 2023-09-06Area: Adversarial RobustnessCitations: 287 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (93%) | 287 |
| Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review Gongshen Liu, Haodong Zhao, Pengzhou Cheng, Wei Du Published: 2023-09-12Area: Adversarial RobustnessCitations: 51 Tags: adversarial-robustness, ai-safety, survey | 2023-09-12 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E7 / R3 (94%) | 51 |
| Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu Published: 2023-09-12Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 137 |
| Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM Bochuan Cao, Jinghui Chen, Lu Lin, Yuanpu Cao Published: 2023-09-18Area: Adversarial RobustnessCitations: 211 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R2 (96%) | 211 |
| GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts Jiahao Yu, Xingwei Lin, Xinyu Xing, Zheng Yu Published: 2023-09-19Area: Adversarial RobustnessCitations: 537 Tags: adversarial-robustness, ai-safety, red-teaming, tool | 2023-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, red-teaming, tool | E5 / R3 (97%) | 537 |
| How Robust is Google's Bard to Adversarial Image Attacks? Hang Su, Huanran Chen, Jiawei Chen, Jun Zhu Published: 2023-09-21Area: Multimodal SafetyCitations: 174 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R4 (95%) | 174 |
| Large Language Model Alignment: A Survey Chuang Liu, Deyi Xiong, Renren Jin, Tianhao Shen Published: 2023-09-26Area: Surveys & ReviewsCitations: 292 Tags: adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | 2023-09-26 | Surveys & Reviews | adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | E6 / R4 (97%) | 292 |
| LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model Ankit Shah, Bhiksha Raj, Dareen Alharthi, Hazim T Bukhari Published: 2023-10-02Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 24 |
| AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models Chaowei Xiao, Muhao Chen, Nan Xu, Xiaogeng Liu Published: 2023-10-03Area: Adversarial RobustnessCitations: 618 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 618 |
| Can Language Models be Instructed to Protect Personal Information? Alan Ritter, Ethan Mendes, Sauvik Das, Wei Xu Published: 2023-10-03Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 48 |
| Low-Resource Languages Jailbreak GPT-4 Cristina Menghini, Stephen H. Bach, Zheng-Xin Yong Published: 2023-10-03Area: Adversarial RobustnessCitations: 291 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 291 |
| Misusing Tools in Large Language Models With Visual Adversarial Examples Earlence Fernandes, Niloofar Mireshghallah, Rajesh K. Gupta, Shuheng Li Published: 2023-10-04Area: Multimodal SafetyCitations: 35 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-10-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 35 |
| Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models Dahua Lin, Linda Petzold, Qi Zhang, William Yang Wang Published: 2023-10-04Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (98%) | 261 |
| SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks Alexander Robey, Eric Wong, George J. Pappas, Hamed Hassani Published: 2023-10-05Area: Adversarial RobustnessCitations: 414 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 414 |
| SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese Hang Xue, Kangkang Zhao, Lei Zhu, Liang Xu Published: 2023-10-09Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 22 |
| Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation Danqi Chen, Kai Li, Mengzhou Xia, Samyak Gupta Published: 2023-10-10Area: Adversarial RobustnessCitations: 437 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R4 (96%) | 437 |
| Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations Yifei Wang, Yisen Wang, Zeming Wei Published: 2023-10-10Area: Adversarial RobustnessCitations: 423 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (95%) | 423 |