Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search Wenbo Guo, Xiangyu Zhang, Xuan Chen, Yuzhou Nie Published: 2024-06-13Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 47 |
| garak: A Framework for Security Probing Large Language Models Erick Galinkin, Jeffrey Martin, Leon Derczynski, Nanna Inie Published: 2024-06-16Area: Safety EvaluationCitations: 38 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-16 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R4 (96%) | 38 |
| RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models Chenhao Wang, Hongbang Yuan, Jiachun Li, Jun Zhao Published: 2024-06-16Area: Model EditingCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark, model-editing | 2024-06-16 | Model Editing | adversarial-robustness, ai-safety, benchmark, model-editing | E5 / R3 (95%) | 57 |
| Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis Han Xu, Hui Liu, Jiliang Tang, Makoto Yamada Published: 2024-06-16Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (94%) | 49 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| Is poisoning a real threat to LLM alignment? Maybe more so than you think Furong Huang, Pankayaraj Pathmanathan, Souradip Chakraborty, Xiangyu Liu Published: 2024-06-17Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (95%) | 28 |
| Dissecting Adversarial Robustness of Multimodal LM Agents Aditi Raghunathan, Chen Henry Wu, Daniel Fried, Jing Yu Koh Published: 2024-06-18Area: Adversarial RobustnessCitations: 84 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 84 |
| SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models Animesh Mukherjee, Rima Hazra, Sayan Layek, Shanu Kumar Published: 2024-06-18Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 14 |
| Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings Bingda Tang, Dongping Chen, Jingyu Tang, Lichao Sun Published: 2024-06-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 7 |
| Adversaries Can Misuse Combinations of Safe Models Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2024-06-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 21 |
| Jailbreaking as a Reward Misspecification Problem Jiahui Gao, Lei Li, Lingpeng Kong, Qi Liu Published: 2024-06-20Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| Prompt Injection Attacks in Defended Systems Bulat Nutfullin, Daniil Khomsky, Narek Maloyan Published: 2024-06-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 6 |
| Deciphering the Definition of Adversarial Robustness for post-hoc OOD Detectors Jens M眉ller, Mario Fernandez, Peter Lorenz, Ullrich K枚the Published: 2024-06-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking Siyuan Wang, Zhihao Fan, Zhongyu Wei, Zhuohan Long Published: 2024-06-21Area: Surveys & ReviewsCitations: 22 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E7 / R4 (95%) | 22 |
| Logicbreaks: A Framework for Understanding Subversion of Rule-based Inference Anton Xue, Avishree Khare, Eric Wong, Rajeev Alur Published: 2024-06-21Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, theoretical | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 4 |
| Steering Without Side Effects: Improving Post-Deployment Control of Language Models Alexander Lyzhov, Asa Cooper Stickland, Jacob Pfau, Salsabila Mahdi Published: 2024-06-21Area: Model EditingCitations: 41 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-06-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 41 |
| BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models Bo Li, Dawn Song, Ruoxi Jia, Tran Ngoc Huynh Published: 2024-06-24Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 49 |
| JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models Chonghan Chen, Haibo Jin, Haohan Wang, Jun Zhuang Published: 2024-06-26Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, survey | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (97%) | 61 |
| WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Allyson Ettinger, Bill Yuchen Lin, Kavel Rao, Liwei Jiang Published: 2024-06-26Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, tool | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (96%) | 261 |
| Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation Alexander Wei, Danny Halawi, Eric Wallace, Jacob Steinhardt Published: 2024-06-28Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 68 |
| Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection Hanchi Sun, Lichao Sun, Lin Lu, Pan Zhou Published: 2024-06-28Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 23 |
| Badllama 3: removing safety finetuning from Llama 3 in minutes Dmitrii Volkov Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 6 |
| Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement Cenyuan Zhang, Feiran Zhang, Xiaohua Wang, Xiaoqing Zheng Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks Barbara Di Eugenio, Henry Peng Zou, Yang Zhang, Yue Zhou Published: 2024-07-01Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Purple-teaming LLMs with Adversarial Defender Training Helen Meng, Jiawen Kang, Jingyan Zhou, Junan Li Published: 2024-07-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models Md Montasir Bin Shams, Shaeke Salman, Xiuwen Liu Published: 2024-07-01Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 2 |
| A False Sense of Safety: Unsafe Information Leakage in 'Safe' AI Responses David Glukhov, Ilia Shumailov, Nicolas Papernot, Vardan Papyan Published: 2024-07-02Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, theoretical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | 11 |
| SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters Guanhua Chen, Hailiang Huang, Hongru Wang, Xin Lu Published: 2024-07-02Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 6 |
| Towards More Realistic Extraction Attacks: An Adversarial Perspective Golnoosh Farnadi, Prakhar Ganesh, Yash More Published: 2024-07-02Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 9 |
| From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks Chujie Zheng, Hongning Wang, Junxiao Yang, Minlie Huang Published: 2024-07-03Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 14 |