Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Automatic Discovery of Visual Circuits Achyuta Rajaram, Antonio Torralba, Jacob Andreas, Neil Chowdhury Published: 2024-04-22Area: Mechanistic Interp.Citations: 10 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-04-22 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 10 |
| Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs Florian Tram猫r, Francesco Croce, Javier Rando, Kry拧tof Mitka Published: 2024-04-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, benchmark | 2024-04-22 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 24 |
| Investigating Adversarial Trigger Transfer in Large Language Models Arkil Patel, Nicholas Meade, Siva Reddy Published: 2024-04-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Don't Say No: Jailbreaking LLM by Suppressing Refusal Wenjie Wang, Yukai Zhou Published: 2024-04-25Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 46 |
| Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples Jindong Gu, Kuofeng Gao, Philip Torr, Shu-Tao Xia Published: 2024-04-25Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 17 |
| Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs James Zou, Valeriia Cherepanova Published: 2024-04-26Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 9 |
| Espresso: Robust Concept Filtering in Text-to-Image Models Anudeep Das, N. Asokan, Rui Zhang, Vasisht Duddu Published: 2024-04-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 13 |
| Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent Liya Su, Shang Shang, Xiaodan Zhang, Xinqiang Zhao Published: 2024-05-06Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (98%) | 11 |
| A Causal Explainable Guardrails for Large Language Models Kui Ren, Longfei Li, Yan Wang, Zhan Qin Published: 2024-05-07Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (94%) | 17 |
| LLM-Generated Black-box Explanations Can Be Adversarially Helpful Frank Rudzicz, Rohan Ajwani, Shashidhar Reddy Javaji, Zining Zhu Published: 2024-05-10Area: Deception & FailureCitations: 28 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (95%) | 28 |
| PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition Jakob Foerster, Qizhen Zhang, Ziyang Zhang Published: 2024-05-13Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 35 |
| Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization Kai Chen, Kai Hu, Lijun Yu, Matt Fredrikson Published: 2024-05-15Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Adversarial Robustness for Visual Grounding of Multimodal Large Language Models Jiawang Bai, Kuofeng Gao, Shu-Tao Xia, Yang Bai Published: 2024-05-16Area: Multimodal SafetyCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (93%) | 26 |
| Learnable Privacy Neurons Localization in Language Models Ruizhe Chen, Tianxiang Hu, Yang Feng, Zuozhu Liu Published: 2024-05-16Area: Mechanistic Interp.Citations: 30 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-05-16 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 30 |
| Hummer: Towards Limited Competitive Preference Dataset Jingqing Ruan, Junwu Xiong, Jun Zhou, Li Jiang Published: 2024-05-19Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, dataset | 2024-05-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, dataset | E6 / R3 (96%) | 10 |
| Lockpicking LLMs: A Logit-Based Jailbreak Using Token-level Manipulation Gelei Deng, Kailong Wang, Ling Shi, Shengquan Chen Published: 2024-05-20Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming Jianhong Wang, Jiaxu Liu, Meng Fang, Sihao Wu Published: 2024-05-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models Gongshen Liu, Pengzhou Cheng, Ping Yi, Tianjie Ju Published: 2024-05-22Area: Adversarial RobustnessCitations: 56 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 56 |
| MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability Bing Qin, Danyang Zhao, Dongliang Xu, Liangyu Huo Published: 2024-05-23Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 15 |
| Representation Noising: A Defence Mechanism Against Harmful Finetuning Carsten Maple, David Atanasov, Domenic Rosati, Frank Rudzicz Published: 2024-05-23Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (94%) | 66 |
| Efficient Adversarial Training in LLMs with Continuous Attacks Alessandro Sordoni, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-05-24Area: Adversarial RobustnessCitations: 103 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (100%) | 103 |
| No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks Chak Tou Leong, Hanlin Wang, Jian Wang, Kaishuai Xu Published: 2024-05-25Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 31 |
| Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character Bo Li, Chaowei Xiao, Muhao Chen, Siyuan Ma Published: 2024-05-25Area: Multimodal SafetyCitations: 59 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 59 |
| Medical MLLM Is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models Chengwei Pan, Hantao Zhang, Hao Wang, Jiawen Xi Published: 2024-05-26Area: Multimodal SafetyCitations: 15 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 15 |
| Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer Boyi Liu, Hongyi Guo, Jose Blanchet, Miao Lu Published: 2024-05-26Area: Alignment TrainingCitations: 90 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | 90 |
| Pruning for Robust Concept Erasing in Diffusion Models Chang Xu, Juan Cao, Tianyun Yang Published: 2024-05-26Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 25 |
| Exploiting the Layered Intrinsic Dimensionality of Deep Models for Practical Adversarial Training Enes Altinisik, Hassan Sajjad, Husrev Taha Sencar, Safa Messaoud Published: 2024-05-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 1 |
| A Theoretical Understanding of Self-Correction through In-context Alignment Stefanie Jegelka, Yifei Wang, Yisen Wang, Yuyang Wu Published: 2024-05-28Area: Alignment TrainingCitations: 56 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E6 / R4 (93%) | 56 |
| Exploiting LLM Quantization Jingxuan He, Kazuki Egashira, Mark Vero, Martin Vechev Published: 2024-05-28Area: Adversarial RobustnessCitations: 53 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 53 |
| Improved Generation of Adversarial Examples Against Safety-aligned LLMs Hao Chen, Qizhang Li, Wangmeng Zuo, Yiwen Guo Published: 2024-05-28Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 12 |