Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Exploring Safety Generalization Challenges of Large Language Models via Code Chang Gao, Jing Shao, Junchi Yan, Lizhuang Ma Published: 2024-03-12Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (97%) | 61 |
| Distract Large Language Models for Automatic Jailbreak Attack Guanhua Chen, Yan Yang, Yun Chen, Zeguan Xiao Published: 2024-03-13Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 46 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting Chaowei Xiao, Muhao Chen, Xiaogeng Liu, Yu Li Published: 2024-03-14Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 106 |
| B-AVIBench: Toward Evaluating the Robustness of Large Vision-Language Model on Black-Box Adversarial Visual-Instructions Hao Zhang, Hong Liu, Kaipeng Zhang, Ping Luo Published: 2024-03-14Area: Multimodal SafetyCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (98%) | 28 |
| Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models Hangyu Guo, Ji-Rong Wen, Kun Zhou, Wayne Xin Zhao Published: 2024-03-14Area: Multimodal SafetyCitations: 101 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 101 |
| RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content Bo Li, Dawn Song, Ning Yu, Ruoxi Jia Published: 2024-03-19Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 67 |
| Securing Large Language Models: Threats, Vulnerabilities and Responsible Practices CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-03-19Area: Surveys & ReviewsCitations: 49 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-03-19 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (98%) | 49 |
| BadEdit: Backdooring Large Language Models by Model Editing Jian Zhang, Kangjie Chen, Shangqing Liu, Tianlin Li Published: 2024-03-20Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 104 |
| FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs Jingyun Zhang, Jinmin Li, Kuofeng Gao, Shu-tao Xia Published: 2024-03-20Area: Multimodal SafetyCitations: 12 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 12 |
| Testing the Limits of Jailbreaking Defenses with the Purple Problem Aditi Raghunathan, Suhas Kotha, Taeyoun Kim Published: 2024-03-20Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 8 |
| Optimization-based Prompt Injection Attack to LLM-as-a-Judge Jiawen Shi, Lichao Sun, Neil Zhenqiang Gong, Pan Zhou Published: 2024-03-26Area: Adversarial RobustnessCitations: 132 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 132 |
| JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Alexander Robey, Edgar Dobriban, Edoardo Debenedetti, Eric Wong Published: 2024-03-28Area: Adversarial RobustnessCitations: 330 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-03-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 330 |
| Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models Jonas Geiping, Leo Marchyok, Nicholas Carlini, Sanghyun Hong Published: 2024-04-01Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 29 |
| What's in Your "Safe" Data? Identifying Benign Data that Breaks Safety Luxi He, Mengzhou Xia, Peter Henderson Published: 2024-04-01Area: Adversarial RobustnessCitations: 95 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 95 |
| Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks Francesco Croce, Maksym Andriushchenko, Nicolas Flammarion Published: 2024-04-02Area: Adversarial RobustnessCitations: 407 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (99%) | 407 |
| Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models Anda Cao, Chao Ye, Jiachen Ma, Jie Zhang Published: 2024-04-02Area: Multimodal SafetyCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 64 |
| JailBreakV-28K: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks Chaowei Xiao, Siyuan Ma, Weidi Luo, Xiaogeng Liu Published: 2024-04-03Area: Multimodal SafetyCitations: 182 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-04-03 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | 182 |
| Robust Concept Erasure Using Task Vectors Chinmay Hegde, Kelly O. Marshall, Minh Pham, Niv Cohen Published: 2024-04-04Area: Model EditingCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 27 |
| ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-04-06Area: Safety EvaluationCitations: 83 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-04-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E4 / R3 (96%) | 83 |
| Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data Dana Alon, Donald Metzler, Tim Baumg盲rtner, Yang Gao Published: 2024-04-08Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 35 |
| Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge Cen Chen, Huiping Zhuang, Jianwei Wang, Weikai Lu Published: 2024-04-08Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 49 |
| AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts Christopher Parisien, Erick Galinkin, Prasoon Varshney, Shaona Ghosh Published: 2024-04-09Area: Adversarial RobustnessCitations: 94 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 94 |
| Rethinking How to Evaluate Language Model Jailbreak Antonio Bianchi, Arjun Arunasalam, Hongyu Cai, Leo Y. Lin Published: 2024-04-09Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-04-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (94%) | 12 |
| SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models Chen Yan, Jiangyi Deng, Wenyuan Xu, Xiaoyu Ji Published: 2024-04-10Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 49 |
| AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs Huan Sun, Zeyi Liao Published: 2024-04-11Area: Adversarial RobustnessCitations: 153 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 153 |
| Latent Guard: a Safety Framework for Text-to-image Generation Ashkan Khakzar, Fabio Pizzati, Jindong Gu, Philip Torr Published: 2024-04-11Area: Multimodal SafetyCitations: 56 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 56 |
| JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models Minfeng Zhu, Sijia Wang, Wei Chen, Wei Zhang Published: 2024-04-12Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-04-12 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 8 |
| The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions Alex Beutel, Eric Wallace, Johannes Heidecke, Kai Xiao Published: 2024-04-19Area: Adversarial RobustnessCitations: 257 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 257 |
| Trojan Detection in Large Language Models: Insights from The Trojan Detection Challenge Bislan Ashinov, Bulat Nutfullin, Ekansh Verma, Narek Maloyan Published: 2024-04-21Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 18 |