Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs Feng Liu, Jie Wen, Jizhong Han, Lijia Lv Published: 2024-09-11Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 7 |
| Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks Ahmed Imteaj, Md Zarif Hossain Published: 2024-09-11Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-09-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 14 |
| Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks Benji Peng, Junyu Liu, Keyu Chen, Ming Li Published: 2024-09-12Area: Surveys & ReviewsCitations: 31 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-09-12 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (94%) | 31 |
| Jailbreaking Large Language Models with Symbolic Mathematics Emet Bethany, Juan Arturo Nolazco Flores, Mazal Bethany, Peyman Najafirad Published: 2024-09-17Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 10 |
| Backtracking Improves Generation Safety Daniel M. Bikel, Eric Michael Smith, Hailey Nguyen, Jason Weston Published: 2024-09-22Area: Adversarial RobustnessCitations: 25 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (97%) | 25 |
| Effective and Evasive Fuzz Testing-Driven Jailbreaking Attacks against LLMs Chen Chen, Fengyuan Ran, Kwok-Yan Lam, Mingzhe Li Published: 2024-09-23Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 14 |
| PROMPTFUZZ: Harnessing Fuzzing Techniques for Robust Testing of Prompt Injection in LLMs Hanwen Miao, Jiahao Yu, Junzheng Shi, Xinyu Xing Published: 2024-09-23Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, tool | 2024-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 20 |
| Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction Jinchuan Zhang, Songlin Hu, Yan Zhou, Yaxin Liu Published: 2024-09-25Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-09-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 22 |
| Training Language Models to Win Debates with Self-Play Improves Judge Accuracy David Rein, Julian Michael, Samuel Arnesen Published: 2024-09-25Area: Scalable OversightCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2024-09-25 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E6 / R3 (93%) | 10 |
| An Adversarial Perspective on Machine Unlearning for AI Safety Boyi Wei, Florian Tram猫r, Jakub 艁ucki, Javier Rando Published: 2024-09-26Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 90 |
| RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking Jay Pujara, Kashif Munir, Kriti Aggarwal, Subhabrata Mukherjee Published: 2024-09-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | - |
| Multimodal Pragmatic Jailbreak on Text-to-image Models Gengyuan Zhang, Jindong Gu, Philip Torr, Tong Liu Published: 2024-09-27Area: Multimodal SafetyCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-09-27 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (95%) | 12 |
| GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks Chang Hu, Han Chen, Meng Han, Minjie Chen Published: 2024-09-29Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark | 2024-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R4 (98%) | 7 |
| Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges Chaowei Xiao, Fei Wang, Jiashu Xu, Muhao Chen Published: 2024-09-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, survey | 2024-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (94%) | 13 |
| Robust LLM Safeguarding via Refusal Feature Adversarial Training Karen Hambardzumyan, Lei Yu, Nicola Cancedda, Virginie Do Published: 2024-09-30Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 47 |
| PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System Amanda J. Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2024-10-01Area: Safety EvaluationCitations: 15 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | 2024-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E6 / R4 (96%) | 15 |
| Automated Red Teaming with GOAT: the Generative Offensive Agent Tester Aaron Grattafiori, Cristian Canton Ferrer, Erik Brinkman, Hailey Nguyen Published: 2024-10-02Area: Safety EvaluationCitations: 32 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-10-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (98%) | 32 |
| Endless Jailbreaks with Bijection Learning Brian R.Y. Huang, Leonard Tang, Maximilian Li Published: 2024-10-02Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 16 |
| FlipAttack: Jailbreak LLMs via Flipping Bryan Hooi, Jinlan Fu, Miao Xiong, Shumin Deng Published: 2024-10-02Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 47 |
| HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard Models Dominik Wagner, Dong Bok Lee, Haebin Seong, Juho Lee Published: 2024-10-02Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 16 |
| AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs Bo Li, Chaowei Xiao, Edward Suh, Huan Sun Published: 2024-10-03Area: Adversarial RobustnessCitations: 120 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 120 |
| HiddenGuard: Fine-Grained Safe Generation with Specialized Representation Router Baolong Bi, Lingrui Mei, Ruibin Yuan, Shenghua Liu Published: 2024-10-03Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 10 |
| Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong Published: 2024-10-03Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 13 |
| Safeguard is a Double-edged Sword: Denial-of-service Attack on Large Language Models Qingzhao Zhang, Ziyang Xiong, Z. Morley Mao Published: 2024-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step Jen-tse Huang, Kuiyi Gao, Qiuzhi Liu, Shuai Wang Published: 2024-10-04Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 8 |
| Gradient-based Jailbreak Images for Multimodal Fusion Models Erik Brinkman, Florian Tram猫r, Hannah Korevaar, Ivan Evtimov Published: 2024-10-04Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| ShieldDiff: Suppressing Sexual Content Generation from Diffusion Models through Reinforcement Learning Dong Han, Salaheldin Mohamed, Yong Li Published: 2024-10-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 4 |
| You Know What I'm Saying: Jailbreak Attack via Implicit Reference Lingrui Mei, Lujun Li, Ruibin Yuan, Tianyu Wu Published: 2024-10-04Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 14 |
| ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs Guangyu Shen, Kaiyuan Zhang, Lu Yan, Siyuan Cheng Published: 2024-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 1 |
| Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong Published: 2024-10-05Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | 5 |