Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In Ateret Anaby-Tavor, George Kour, Guy Uziel, Itay Nakash Published: 2024-10-22Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 18 |
| LLMScan: Causal Scan for LLM Misbehavior Detection Jun Sun, Kai Kiat Goh, Mengdi Zhang, Peixin Zhang Published: 2024-10-22Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 6 |
| Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing Dongliang Guo, Junfeng Guo, Mengxuan Hu, Sheng Li Published: 2024-10-23Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 5 |
| Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks Aobo Yang, Bobbie Chern, Han Zhao, Jianfeng Chi Published: 2024-10-23Area: Adversarial RobustnessCitations: 36 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 36 |
| Adversarial Attacks on Large Language Models Using Regularized Relaxation Chashi Mahiul Islam, Fatema Tabassum Liza, Sajib Biswas, Samuel Jacob Chacko Published: 2024-10-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 10 |
| RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction Changjiang Li, Jiacheng Liang, Tanqiu Jiang, Ting Wang Published: 2024-10-25Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 23 |
| BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks Lin Luo, Xiang Zheng, Xingjun Ma, Yige Li Published: 2024-10-28Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | 22 |
| Reducing the Scope of Language Models with Circuit Breakers Chulaka Gunasekara, Danish Contractor, David Yunis, Siyu Huo Published: 2024-10-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring Han He, Honglin Mu, Libo Qin, Qingfu Zhu Published: 2024-10-28Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts Huan Sun, Jaylen Jones, Vishal Kumar, Zeyi Liao Published: 2024-10-29Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 8 |
| Embedding-based classifiers can detect prompt injection attacks Md. Ahsan Ayub, Subhabrata Majumdar Published: 2024-10-29Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 24 |
| IDEATOR: Jailbreaking Large Vision-Language Models Using Themselves Bo Wang, Ruofan Wang, Xiaosen Wang, Xingjun Ma Published: 2024-10-29Area: Multimodal SafetyCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (99%) | 9 |
| Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector Fengbin Zhu, Jiancheng Lv, Jingkun Tang, Pan Zhou Published: 2024-10-30Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 5 |
| Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey Chiyu Zhang, Jiafei Wu, Lu Zhou, Xiaogang Xu Published: 2024-10-31Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, survey | 2024-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (95%) | 31 |
| Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs Elgizouli Mohamed, Muhammad Abdul-Mageed, Muhammed Saeed, Mukhtar Mohamed Published: 2024-10-31Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-10-31 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E6 / R3 (95%) | - |
| Pseudo-Conversation Injection for LLM Goal Hijacking Buhui Yao, Zheng Chen Published: 2024-10-31Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 4 |
| Emoji Attack: A Method for Misleading Judge LLMs in Safety Risk Detection N. Benjamin Erichson, Yuqi Liu, Zhipeng Wei Published: 2024-11-01Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 19 |
| Plentiful Jailbreaks with String Compositions Brian R.Y. Huang Published: 2024-11-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks Nathalie Maria Kirch, Severin Field, Stephen Casper Published: 2024-11-02Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 23 |
| SQL Injection Jailbreak: a structural disaster of large language models Jiawei Zhao, Kejiang Chen, Nenghai Yu, Weiming Zhang Published: 2024-11-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 6 |
| UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models Donghyun Kim, Eric Ma, Gaurav Verma, Megha Sharma Published: 2024-11-03Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 14 |
| Attacking Vision-Language Computer Agents via Pop-ups Diyi Yang, Tao Yu, Yanzhe Zhang Published: 2024-11-04Area: Adversarial RobustnessCitations: 80 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 80 |
| Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment Gagandeep Singh, Gaokai Zhang, Hangoo Kang, Jason Vega Published: 2024-11-05Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| Diversity Helps Jailbreak Large Language Models Chengzhi Mao, Daniel Ben-Levi, Junfeng Yang, Weiliang Zhao Published: 2024-11-06Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 4 |
| MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue Chongwen Wang, Fengxiang Wang, Hang Su, Hui Xue Published: 2024-11-06Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 29 |
| Unfair Alignment: Examining Safety Alignment Across Vision Encoder Layers in Vision-Language Models Amit K. Roy-Chowdhury, Arindam Dutta, Chengyu Song, Erfan Shayegani Published: 2024-11-06Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-06 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 2 |
| Adversarial Robustness of In-Context Learning in Transformers for Linear Regression David Krueger, Johannes von Oswald, Louis Kirsch, Spencer Frei Published: 2024-11-07Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains Bijoy Ahmed Saiem, Md Rafi ur Rashid, MD Sadik Hossain Shanto, Rakib Ahsan Published: 2024-11-10Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 11 |
| The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense Fangkai Jiao, Liqiang Nie, Mohan Kankanhalli, Yangyang Guo Published: 2024-11-13Area: Multimodal SafetyCitations: 19 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 19 |
| Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey Huaibo Huang, Miaoxuan Zhang, Peipei Li, Ran He Published: 2024-11-14Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2024-11-14 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E5 / R4 (96%) | 25 |