Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks Carlos Guestrin, Daniel Kang, Ion Stoica, Matei Zaharia Published: 2023-02-11Area: Adversarial RobustnessCitations: 345 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 345 |
| Poisoning Web-Scale Training Datasets is Practical Andreas Terzis, Christopher A. Choquette-Choo, Daniel Paleka, Florian Tram猫r Published: 2023-02-20Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 284 |
| BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT Jiawen Shi, Lichao Sun, Pan Zhou, Yixin Liu Published: 2023-02-21Area: Adversarial RobustnessCitations: 102 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 102 |
| Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection Christoph Endres, Kai Greshake, Mario Fritz, Sahar Abdelnabi Published: 2023-02-23Area: Adversarial RobustnessCitations: 894 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 894 |
| Multi-step Jailbreaking Privacy Attacks on ChatGPT Dadi Guo, Fanpu Meng, Haoran Li, Jie Huang Published: 2023-04-11Area: Adversarial RobustnessCitations: 462 Tags: adversarial-robustness, ai-safety, empirical | 2023-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 462 |
| Fundamental Limitations of Alignment in Large Language Models Amnon Shashua, Noam Wies, Oshri Avnery, Yoav Levine Published: 2023-04-19Area: Formal/TheoreticalCitations: 178 Tags: adversarial-robustness, ai-safety, alignment-training, formaltheoretical, theoretical | 2023-04-19 | Formal/Theoretical | adversarial-robustness, ai-safety, alignment-training, formaltheoretical, theoretical | E4 / R2 (94%) | 178 |
| Poisoning Language Models During Instruction Tuning Alexander Wan, Dan Klein, Eric Wallace, Sheng Shen Published: 2023-05-01Area: Adversarial RobustnessCitations: 290 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 290 |
| SneakyPrompt: Jailbreaking Text-to-Image Generative Models Bo Hui, Haolin Yuan, Neil Gong, Yinzhi Cao Published: 2023-05-20Area: Adversarial RobustnessCitations: 165 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 165 |
| Adversarial Nibbler: A Data-Centric Challenge for Improving the Safety of Text-to-Image Models Addison Howard, Alicia Parrish, Charvi Rastogi, D. Sculley Published: 2023-05-22Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 12 |
| Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study Gelei Deng, Kailong Wang, Lida Zhao, Tianwei Zhang Published: 2023-05-23Area: Adversarial RobustnessCitations: 636 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 636 |
| Adversarial Demonstration Attacks on Large Language Models Chaowei Xiao, Jiongxiao Wang, Keun Hee Park, Muhao Chen Published: 2023-05-24Area: Adversarial RobustnessCitations: 71 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 71 |
| Tricking LLMs into Disobedience: Understanding, Analyzing, and Preventing Jailbreaks Abhinav Rao, Atharva Naik, Monojit Choudhury, Sachin Vashistha Published: 2023-05-24Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 46 |
| On Evaluating Adversarial Robustness of Large Vision-Language Models Chao Du, Chongxuan Li, Min Lin, Ngai-Man Cheung Published: 2023-05-26Area: Multimodal SafetyCitations: 287 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R3 (97%) | 287 |
| PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts Hao Chen, Jiaheng Zhou, Jindong Wang, Kaijie Zhu Published: 2023-06-07Area: Adversarial RobustnessCitations: 235 Tags: adversarial-robustness, ai-safety, benchmark | 2023-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 235 |
| Prompt Injection attack against LLM-integrated Applications Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-06-08Area: Adversarial RobustnessCitations: 620 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 620 |
| Adversarial Attacks on the Interpretation of Neuron Activation Maximization Alexander Fulleringer, Eugene Belilovsky, G茅raldin Nanfack, Jonathan Marty Published: 2023-06-12Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 12 |
| DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Bo Li, Boxin Wang, Chejian Xu, Chenhui Zhang Published: 2023-06-20Area: Safety EvaluationCitations: 575 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-06-20 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 575 |
| Visual Adversarial Examples Jailbreak Aligned Large Language Models Ashwinee Panda, Kaixuan Huang, Mengdi Wang, Peter Henderson Published: 2023-06-22Area: Multimodal SafetyCitations: 295 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-06-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 295 |
| Are Aligned Neural Networks Adversarially Aligned? Anas Awadalla, Christopher A. Choquette-Choo, Daphne Ippolito, Florian Tramer Published: 2023-06-26Area: Adversarial RobustnessCitations: 325 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 325 |
| On the Exploitability of Instruction Tuning Chaowei Xiao, Chen Zhu, Jiongxiao Wang, Jonas Geiping Published: 2023-06-28Area: Adversarial RobustnessCitations: 135 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 135 |
| Jailbroken: How Does LLM Safety Training Fail? Alexander Wei, Jacob Steinhardt, Nika Haghtalab Published: 2023-07-05Area: Adversarial RobustnessCitations: 1522 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1522 |
| Understanding Multi-Turn Toxic Behaviors in Open-Domain Chatbots Bocheng Chen, Guangjing Wang, Hanqing Guo, Qiben Yan Published: 2023-07-14Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 26 |
| MasterKey: Automated Jailbreaking of Large Language Model Chatbots Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-07-16Area: Adversarial RobustnessCitations: 206 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 206 |
| (Ab)using Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs Ben Nassi, Eugene Bagdasaryan, Tsung-Yin Hsieh, Vitaly Shmatikov Published: 2023-07-19Area: Multimodal SafetyCitations: 121 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 121 |
| CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility Chao Peng, Fei Huang, Guohai Xu, Haotian Xu Published: 2023-07-19Area: Safety EvaluationCitations: 99 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2023-07-19 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 99 |
| FACADE: A Framework for Adversarial Circuit Anomaly Detection and Evaluation Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Mechanistic Interp.Citations: 2 Tags: adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | 2023-07-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | E5 / R3 (94%) | 2 |
| LLM Censorship: A Machine Learning Challenge or a Computer Security Problem? David Glukhov, Ilia Shumailov, Nicolas Papernot, Vardan Papyan Published: 2023-07-20Area: Adversarial RobustnessCitations: 72 Tags: adversarial-robustness, ai-safety, theoretical | 2023-07-20 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | 72 |
| Jailbreak in Pieces: Compositional Adversarial Attacks on Multi-Modal Language Models Erfan Shayegani, Nael Abu-Ghazaleh, Yue Dong Published: 2023-07-26Area: Multimodal SafetyCitations: 240 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-07-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R2 (93%) | 240 |
| Backdoor Attacks for In-Context Learning with Language Models Florian Tram猫r, Matthew Jagielski, Nicholas Carlini, Nikhil Kandpal Published: 2023-07-27Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 111 |
| Universal and Transferable Adversarial Attacks on Aligned Language Models Andy Zou, J. Zico Kolter, Matt Fredrikson, Milad Nasr Published: 2023-07-27Area: Adversarial RobustnessCitations: 2514 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2514 |