Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections Abhradeep Thakurta, Andreas Terzis, Chawin Sitawarin, Florian Tram猫r Published: 2025-10-10Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E10 / R3 (99%) | 26 |
| VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search Guangze Zhao, MingSheng Li, Sichen Liu Published: 2025-10-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming Hanbo Song, Keqing He, Kongming Liang, Lulu Zhao Published: 2025-10-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | - |
| Fewer Weights, More Problems: A Practical Attack on LLM Pruning Kazuki Egashira, Mark Vero, Martin Vechev, Robin Staab Published: 2025-10-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 2 |
| From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses Li Wang, Shanqing Guo, Tianshuo Cong, Wenyu Chen Published: 2025-10-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection Cen Chen, Hui Xue, Jianmei Guo, Mengjie Wu Published: 2025-10-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models Jun Sakuma, Kazuhiro Nakadai, Ragib Amin Nihal, Rui Wen Published: 2025-10-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 1 |
| Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs Anh Tuan Luu, Jinbo Feng, Linghui Meng, Man Hu Published: 2025-10-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, survey | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | - |
| VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands Aofan Liu, Lulu Tang Published: 2025-10-09Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-09 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R5 (97%) | - |
| Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples Alexandra Souly, Burak Hasircioglu, Carlos Mougan, Chris Hicks Published: 2025-10-08Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 24 |
| A Survey on Agentic Security: Applications, Threats and Defenses Asif Shahriar, Farig Sadeque, Md Nafiu Rahman, Md Rizwan Parvez Published: 2025-10-07Area: Agent SafetyCitations: 6 Tags: adversarial-robustness, agent-safety, ai-safety, survey | 2025-10-07 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, survey | E6 / R4 (96%) | 6 |
| LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback Amin Karbasi, Battista Biggio, Giorgio Piras, Kamil臈 Luko拧i奴t臈 Published: 2025-10-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Imperceptible Jailbreaking against Large Language Models Chao Du, Kuofeng Gao, Shu-Tao Xia, Tianyu Pang Published: 2025-10-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 1 |
| Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks? Abhay Puri, Alexandre Lacoste, Gabriel Huang, Graham W. Taylor Published: 2025-10-06Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (96%) | 3 |
| RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts Daniel W. Peterson, Dan Roth, Eunsuk Kang, Marianne Menglin Liu Published: 2025-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Kamalika Chaudhuri Published: 2025-10-06Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 8 |
| SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests Devansh Bhardwaj, Hai Son Le, Punya Syon Pandey, Rada Mihalcea Published: 2025-10-06Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-10-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | - |
| AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents Bin Xiao, Dong Wang, Xiangyu He, Yanjie Li Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (98%) | 1 |
| From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs Guangyu Shen, Hanxi Guo, Siyuan Cheng, Xiangyu Zhang Published: 2025-10-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | - |
| Read the Scene, Not the Script: Outcome-Aware Safety for LLMs Rui Wu, Ruixiang Tang, Yanshu Li, Yihao Quan Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 1 |
| SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models Jie Zhang, Kunsheng Tang, Nenghai Yu, Peigui Qi Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods Bryan Hooi, Haoran Li, Yangqiu Song, Yuan Sui Published: 2025-10-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models Anshuman Chhabra, Hadi Askari, Muhao Chen, Shahriar Kabir Nahin Published: 2025-10-04Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| A Granular Study of Safety Pretraining under Model Abliteration Bernt Schiele, Jonas Jakubassa, Margret Keuper, Priyam Dey Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs Jun Luo, Xurui Song, Zhixin Xie Published: 2025-10-03Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| External Data Extraction Attacks against Retrieval-Augmented Large Language Models Boheng Li, Dacheng Tao, Leyi Qi, Shuo Shao Published: 2025-10-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 1 |
| Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs Fatmazohra Rezkellah, Ramzi Dakhmouche Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks Daniel Takabi, Eduardo Blanco, Javad Rafiei Asl, Mohammad Ghasemigol Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 2 |
| Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks Ramayya Krishnan, Rema Padman, Yubo Li Published: 2025-10-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Untargeted Jailbreak Attack Di Wang, Kedong Xiu, Kui Ren, Tianhang Zheng Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 2 |