Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| JailbreakHunter: A Visual Analytics Approach for Jailbreak Prompts Discovery From Large-Scale Human-LLM Conversational Datasets Haotian Li, Huamin Qu, Shiyi Liu, Xun Zhao Published: 2024-07-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, tool | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 6 |
| Automated Progressive Red Teaming Bojian Jiang, Deyi Xiong, Qing Yang, Tianhao Shen Published: 2024-07-04Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E8 / R5 (96%) | 11 |
| Jailbreak Attacks and Defenses Against Large Language Models: A Survey Jiaxing Song, Ke Xu, Qi Li, Sibo Yi Published: 2024-07-05Area: Surveys & ReviewsCitations: 220 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-07-05 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E8 / R4 (98%) | 220 |
| A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends Daizong Liu, Mingyu Yang, Pan Zhou, Wei Hu Published: 2024-07-10Area: Multimodal SafetyCitations: 81 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2024-07-10 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E7 / R5 (96%) | 81 |
| Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture Jiayang Song, Lei Ma, Yuheng Huang, Zhehua Zhou Published: 2024-07-10Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 19 |
| Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing Andrew Zhao, Gao Huang, Huanqian Wang, Jingxin Shi Published: 2024-07-11Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training Jen-tse Huang, Jiahao Xu, Pinjia He, Tian Liang Published: 2024-07-12Area: Adversarial RobustnessCitations: 57 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 57 |
| Self-interpreting Adversarial Images Collin Zhang, Eugene Bagdasaryan, John X. Morris, Tingwei Zhang Published: 2024-07-12Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-12 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 5 |
| DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation Ling Shi, Mingke Yang, Yi Liu, Yuqi Chen Published: 2024-07-14Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-14 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 9 |
| Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models Fan Yang, Felix Juefei-Xu, Guangyan Sun, Kaize Ding Published: 2024-07-15Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 14 |
| Does Refusal Training in LLMs Generalize to the Past Tense? Maksym Andriushchenko, Nicolas Flammarion Published: 2024-07-16Area: Adversarial RobustnessCitations: 70 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 70 |
| Direct Unlearning Optimization for Robust and Safe Text-to-Image Models Gayoung Lee, Geonhui Jang, Jin-Hwa Kim, Junghyo Jo Published: 2024-07-17Area: Model EditingCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (95%) | 42 |
| Adversarial Circuit Evaluation Adri脿 Garriga-Alonso, Niels uit de Bos Published: 2024-07-21Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-07-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts Chengjun Cai, Cong Wang, Xiaoli Zhang, Xingliang Yuan Published: 2024-07-21Area: Multimodal SafetyCitations: 38 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2024-07-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (96%) | 38 |
| Trading Devil Final: Backdoor attack via Stock market and Bayesian Optimization Orson Mengara Published: 2024-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Revisiting the Robust Alignment of Circuit Breakers Leo Schwinn, Simon Geisler Published: 2024-07-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R2 (93%) | 8 |
| Targeted Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs Abhay Sheshadri, Aengus Lynch, Aidan Ewart, Asa Cooper Stickland Published: 2024-07-22Area: Adversarial RobustnessCitations: 112 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 112 |
| Can Large Language Models Automatically Jailbreak GPT-4V? Lichao Sun, Pan Zhou, Xiang Li, Yixin Liu Published: 2024-07-23Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| Figure it Out: Analyzing-based Jailbreak Attack on Large Language Models Changting Lin, Meng Han, Rongchang Li, Shi Lin Published: 2024-07-23Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 3 |
| PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing Blazej Manczak, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan Published: 2024-07-23Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 9 |
| RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent Feng Xiao, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-07-23Area: Safety EvaluationCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 30 |
| FLRT: Fluent Student-Teacher Redteaming Michael Sklar, T. Ben Thompson Published: 2024-07-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 10 |
| Exploring Scaling Trends in LLM Robustness Adam Gleave, Ian McKenzie, Michal Zajac, Nikolaus Howe Published: 2024-07-25Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 11 |
| The Art of Refusal: A Survey of Abstention in Large Language Models Bill Howe, Bingbing Wen, Chenjun Xu, Jihan Yao Published: 2024-07-25Area: Surveys & ReviewsCitations: 55 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-07-25 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 55 |
| Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability Alejandro Mat茅, Jorge Garc铆a-Carrasco, Juan Trujillo Published: 2024-07-29Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 6 |
| Can LLMs be Fooled? Investigating Vulnerabilities in LLMs CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-07-30Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, survey | 2024-07-30 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 9 |
| Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models Wenjie Wang, Xiuyuan Qi, Yue Xu, Zhan Qin Published: 2024-07-31Area: Multimodal SafetyCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 10 |
| Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-to-Image Generation Models Ning Yu, Shanqing Guo, Xiangtao Meng, Yingkai Dong Published: 2024-08-01Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 21 |
| Tamper-Resistant Safeguards for Open-Weight LLMs Alice Gatti, Andy Zhou, Andy Zou, Bhrugu Bharathi Published: 2024-08-01Area: Adversarial RobustnessCitations: 114 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 114 |
| Mission Impossible: A Statistical Perspective on Jailbreaking LLMs Jingtong Su, Julia Kempe, Karen Ullrich Published: 2024-08-02Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-08-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 26 |