Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models An Zhang, Junfeng Fang, Kun Wang, Ruipeng Wang Published: 2025-04-09Area: Multimodal SafetyCitations: 34 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-04-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 34 |
| Geneshift: Impact of different scenario shift on Jailbreaking LLM Bryan Hooi, Jiaheng Zhang, See-Kiong Ng, Tianyi Wu Published: 2025-04-10Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2 |
| PR-Attack: Coordinated Prompt-RAG Attacks on Retrieval-Augmented Generation in Large Language Models via Bilevel Optimization Kai Yang, Xiaodong Wang, Yang Jiao Published: 2025-04-10Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 10 |
| AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender An Zhang, Bing Qin, Jiahe Guo, Tat-Seng Chua Published: 2025-04-13Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 15 |
| Mitigating Many-Shot Jailbreaking Christopher M. Ackerman, Nina Panickssery Published: 2025-04-13Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| SaRO: Enhancing LLM Safety through Reasoning-based Alignment Shikun Zhang, Wei Ye, Yutao Mou, Yuxiao Luo Published: 2025-04-13Area: Alignment TrainingCitations: 16 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-13 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (98%) | 16 |
| The Structural Safety Generalization Problem Ethan Kosak-Hine, George Ingebretsen, Jason Zhang, Julius Broomfield Published: 2025-04-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Ctrl-Z: Controlling AI Agents via Resampling Adam Kaufman, Akbir Khan, Aryan Bhatt, Buck Shlegeris Published: 2025-04-14Area: Agent SafetyCitations: 14 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-04-14 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (93%) | 14 |
| RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability Dongbai Li, Yao Huang, Yichi Zhang, Yinpeng Dong Published: 2025-04-14Area: Alignment TrainingCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-14 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 46 |
| The Jailbreak Tax: How Useful are Your Jailbreak Outputs? Florian Tram猫r, Jie Zhang, Kristina Nikoli膰, Luze Sun Published: 2025-04-14Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 16 |
| GraphAttack: Exploiting Representational Blindspots in LLM Safety Mechanisms An Wang, Sinan He Published: 2025-04-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-04-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | - |
| DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification Han Jiang, Yu Li, Zhihua Wei Published: 2025-04-18Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 3 |
| Manipulating Multimodal Agents via Cross-Modal Prompt Injection Aishan Liu, Le Wang, Mingchuan Zhang, Shengshan Hu Published: 2025-04-19Area: Multimodal SafetyCitations: 21 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 21 |
| REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models Chongye Guo, Guorui Feng, Jinhu Fu, Junfeng Fang Published: 2025-04-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| aiXamine: Simplified LLM Safety and Security Dorde Popovic, Euisuh Jeong, Fatih Deniz, Issa Khalil Published: 2025-04-21Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-04-21 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (98%) | 2 |
| DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization Chun Chen, Churui Zeng, Kedong Xiu, Kui Ren Published: 2025-04-21Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R5 (96%) | 5 |
| RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2025-04-21Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (97%) | 4 |
| WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks Aaron Grattafiori, Arman Zharmagambetov, Chuan Guo, Ivan Evtimov Published: 2025-04-22Area: Adversarial RobustnessCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark | 2025-04-22 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (95%) | 57 |
| Adversarial Attacks on LLM-as-a-Judge Systems: Insights from Prompt Injections Dmitry Namiot, Narek Maloyan Published: 2025-04-25Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E9 / R3 (96%) | 5 |
| Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs Mohammad Akbar-Tajari, Mohammad Mahmoody, Mohammad Taher Pilehvar Published: 2025-04-26Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 1 |
| JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift Annabella Chow, Basel Alomair, Chawin Sitawarin, David Wagner Published: 2025-04-28Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (93%) | 3 |
| SAGE: A Generic Framework for LLM Safety Evaluation Hari Shrawgi, Madhur Jindal, Parag Agrawal, Sandipan Dandapat Published: 2025-04-28Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-04-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | 6 |
| Security Steerability is All You Need Idan Habler, Itay Hazan, Itsik Mantin, Ron Bitton Published: 2025-04-28Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark | 2025-04-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 3 |
| CachePrune: Neural-Based Attribution Defense Against Indirect Prompt Injection Attacks Julian McAuley, Junda Wu, Lina Yao, Rui Wang Published: 2025-04-29Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 6 |
| Erased but Not Forgotten: How Backdoors Compromise Concept Erasure Anna Rohrbach, Jonas Henry Grebe, Marcus Rohrbach, Tobias Braun Published: 2025-04-29Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction Bryan Hooi, Haoran Li, Yangqiu Song, Yuan Sui Published: 2025-04-29Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 15 |
| When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems Jiayang Liu, Jie Zhang, Luu Anh Tuan, Runyi Hu Published: 2025-04-29Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-04-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| Hoist with His Own Petard: Inducing Guardrails to Facilitate Denial-of-Service Attacks on Retrieval-Augmented Generation of LLMs Pan Suo, San-Chuan Guo, Xi Zhang, Yu-Ming Shang Published: 2025-04-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 1 |
| The Dual Power of Interpretable Token Embeddings: Jailbreaking Attacks and Defenses for Diffusion Model Unlearning Qing Qu, Sijia Liu, Siyi Chen, Yimeng Zhang Published: 2025-04-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| XBreaking: Explainable Artificial Intelligence for Jailbreaking LLMs Antonino Nocera, Marco Arazzi, Vignesh Kumar Kembu, Vinod P Published: 2025-04-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |