Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Caution for the Environment: Multimodal Agents are Susceptible to Environmental Distractions Aston Zhang, Hai Zhao, Tongxin Yuan, Xinbei Ma Published: 2024-08-05Area: Agent SafetyCitations: 47 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2024-08-05 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E6 / R3 (95%) | 47 |
| Towards AI-Safety-by-Design: A Taxonomy of Runtime Guardrails in Foundation Model based Systems Dehai Zhao, Liming Zhu, Md Shamsujjoha, Qinghua Lu Published: 2024-08-05Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, survey | 2024-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (97%) | 12 |
| Why Are My Prompts Leaked? Unraveling Prompt Extraction Threats in Customized Large Language Models Haibo Hu, Haoyang Li, Qingqing Ye, Yaxin Xiao Published: 2024-08-05Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 17 |
| Attacks and Defenses for Generative Diffusion Models: A Comprehensive Survey Long Bao Le, Luan Ba Dang, Vu Tuan Truong Published: 2024-08-06Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, survey | 2024-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E8 / R4 (99%) | 48 |
| EnJa: Ensemble Jailbreak on Large Language Models Jiahao Zhang, Ruofan Wang, Xingjun Ma, Yu-Gang Jiang Published: 2024-08-07Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 4 |
| Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles Deyue Zhang, Dongdong Yang, Hui Li, Quanchen Zou Published: 2024-08-08Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-08-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 50 |
| A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares Ben Nassi, Ron Bitton, Stav Cohen Published: 2024-08-09Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 11 |
| ConfusedPilot: Confused Deputy Risks in RAG-based LLMs Ayush RoyChowdhury, Mohit Tiwari, Mulong Luo, Prateek Sahu Published: 2024-08-09Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 16 |
| h4rm3l: A Language for Composable Jailbreak Attack Synthesis Ananjan Nandi, Anna Goldie, Christopher D. Manning, Dan Jurafsky Published: 2024-08-09Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, tool | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (97%) | 11 |
| Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search Robert J. Moss Published: 2024-08-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| MMJ-Bench: A Comprehensive Study on Jailbreak Attacks and Defenses for Vision Language Models Chengyan Fu, Fenghua Weng, Wenjie Wang, Yue Xu Published: 2024-08-16Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-08-16 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E8 / R3 (98%) | - |
| Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning Gautam Bhattacharya, Josh Kimball, Ling Liu, Pratik Joshi Published: 2024-08-18Area: Adversarial RobustnessCitations: 55 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks Dongxia Wang, Jiaying Chen, Kexin Chen, Wenhai Wang Published: 2024-08-18Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |
| DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order Optimization Dong Li, Kaidi Xu, Pucheng Dang, Qi Guo Published: 2024-08-18Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 15 |
| Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh Published: 2024-08-20Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-08-20 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R4 (95%) | 6 |
| MEGen: Generative Backdoor into Large Language Models via Model Editing Hai Zhao, Jiyang Qiu, Qianren Wang, Xinbei Ma Published: 2024-08-20Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (99%) | 7 |
| Perception-guided Jailbreak against Text-to-Image Models Geguang Pu, Le Liang, Run Wang, Tianlin Li Published: 2024-08-20Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (99%) | 27 |
| Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models Hongbang Yuan, Jun Zhao, Kang Liu, Pengfei Cao Published: 2024-08-20Area: Model EditingCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-08-20 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (92%) | 25 |
| Eeg-Defender: Defending against Jailbreak through Early Exit Generation of Large Language Models Chongwen Zhao, Kaizhu Huang, Zhihao Dou Published: 2024-08-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |
| Atoxia: Red-teaming Large Language Models with Target Toxic Answers Anningzhe Gao, Pengyu Cheng, Xiang Wan, Yuhao Du Published: 2024-08-27Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 5 |
| LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet Cristina Menghini, Hugh Zhang, Ian Steneker, Nathaniel Li Published: 2024-08-27Area: Adversarial RobustnessCitations: 118 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 118 |
| Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks Haoyu Wang, Kailong Wang, Ling Shi, Shide Zhou Published: 2024-08-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Legilimens: Practical and Unified Content Moderation for Large Language Model Services Jialin Wu, Jiangyi Deng, Jiayang Xu, Shengyuan Pang Published: 2024-08-28Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks Ethan Kosak-Hine, George Ingebretsen, Jason Zhang, Julius Broomfield Published: 2024-08-29Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | 14 |
| Forget to Flourish: Leveraging Machine-Unlearning on Pretrained Language Models for Privacy Leakage Jing Liu, Md Rafi Ur Rashid, Shagufta Mehnaz, Toshiaki Koike-Akino Published: 2024-08-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 13 |
| The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs Bocheng Chen, Guangjing Wang, Hanqing Guo, Qiben Yan Published: 2024-09-01Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (93%) | 10 |
| Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-09-03Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-09-03 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 61 |
| Recent Advances in Attack and Defense Approaches of Large Language Models Jianbin Jiao, Jing Cui, Junge Zhang, Shuchang Zhou Published: 2024-09-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, survey | 2024-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (95%) | 9 |
| PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions Jiansheng Chen, Ruobing Xie, Xingwu Sun, Yudong Zhang Published: 2024-09-08Area: Multimodal SafetyCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-09-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | 9 |
| Unlearning or Concealment? A Critical Analysis and Evaluation Metrics for Unlearning in Diffusion Models Aakash Sen Sharma, Ankur A. Mali, Murari Mandal, Niladri Sarkar Published: 2024-09-09Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-09-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 9 |