Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| OET: Optimization-based prompt injection Evaluation Toolkit Chaowei Xiao, Jinsheng Pan, Xiaogeng Liu Published: 2025-05-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E6 / R3 (95%) | - |
| Attack and defense techniques in large language models: A survey and new perspectives Hefeng Chen, Kang Chen, Kangkang Li, Xingwang Huang Published: 2025-05-02Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, survey | 2025-05-02 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E7 / R4 (95%) | 5 |
| Helping Large Language Models Protect Themselves: An Enhanced Filtering and Summarization System Sheikh Samit Muhaimin, Spyridon Mastorakis Published: 2025-05-02Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 3 |
| LLM Security: Vulnerabilities, Attacks, Defenses, and Countermeasures Fernando Berzal, Francisco Aguilera-Mart铆nez Published: 2025-05-02Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, survey | 2025-05-02 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (95%) | 13 |
| Transferable Adversarial Attacks on Black-Box Vision-Language Models Alexander Robey, Andy Zou, Chengming Xu, Haoqi Hu Published: 2025-05-02Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (93%) | 7 |
| Cannot See the Forest for the Trees: Invoking Heuristics and Biases to Elicit Irrational Choices of LLMs Haoming Yang, Ke Ma, Qianqian Xu, Qingming Huang Published: 2025-05-03Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 4 |
| Adversarial Attacks in Multimodal Systems: A Practitioner's Survey Aman Raj, Ankit Shetgaonkar, Dipen Pradhan, Lakshit Arora Published: 2025-05-06Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2025-05-06 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E6 / R3 (94%) | 2 |
| LlamaFirewall: An Open Source Guardrail System for Building Secure AI Agents Abraham Montilla, Alekhya Gampa, Beto de Paola, Cyrus Nikolaidis Published: 2025-05-06Area: Adversarial RobustnessCitations: 41 Tags: adversarial-robustness, ai-safety, alignment-training, tool | 2025-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, tool | E5 / R4 (98%) | 41 |
| Patterns and Mechanisms of Contrastive Activation Engineering Ayush Panda, Sheikh Abdur Raheem Ali, Stepan Shabalin, Yixiong Hao Published: 2025-05-06Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-06 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization Wenjun Cao Published: 2025-05-07Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 5 |
| Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs Chetan Pathade Published: 2025-05-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R3 (95%) | 30 |
| Defending against Indirect Prompt Injection by Instruction Detection Chenglong Wang, Fangzhao Wu, Haoyu Tang, Lingjuan Lyu Published: 2025-05-08Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 8 |
| Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks Hongcheng Guo, Leonid Sigal, Yangming Li, Yixin Cheng Published: 2025-05-08Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 7 |
| X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP Hanxun Huang, James Bailey, Sarah Erfani, Xingjun Ma Published: 2025-05-08Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 14 |
| AgentFuzzer: Generic Black-Box Fuzzing for Indirect Prompt Injection against LLM Agents Chenguang Wang, Dawn Song, Tianneng Shi, Vincent Siu Published: 2025-05-09Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 20 |
| Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model Chi Chen, Jinan Xu, Kaiyu Huang, Xiangyu Shi Published: 2025-05-10Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | 2025-05-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 11 |
| Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety Anil Vullikanti, Mengxuan Hu, Ronghang Zhu, Sheng Li Published: 2025-05-11Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 16 |
| Concept-Level Explainability for Auditing & Steering LLM Responses Kenza Amara, Mennatallah El-Assady, Rita Sevastjanova Published: 2025-05-12Area: Representation AnalysisCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-05-12 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 6 |
| One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models Handing Wang, Haoran Gu, Mengjie Zhang, Yaochu Jin Published: 2025-05-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Access Controls Will Solve the Dual-Use Dilemma Ev啪en Wybitul Published: 2025-05-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-14 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 2 |
| Adversarial Attack on Large Language Models using Exponentiated Gradient Descent Mao Nishino, Sajib Biswas, Samuel Jacob Chacko, Xiuwen Liu Published: 2025-05-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Adversarial Suffix Filtering: a Defense Pipeline for LLMs David Khachaturov, Robert Mullins Published: 2025-05-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 2 |
| Layered Unlearning for Adversarial Relearning Ashia Wilson, Dylan Hadfield-Menell, Timothy Qian, Vinith Suriyakumar Published: 2025-05-14Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-14 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization Binxing Fang, Fang Fang, Yanan Cao, Yidan Wang Published: 2025-05-15Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 9 |
| AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models Fenglong Ma, Jiacheng Liang, Rongyi Zhu, Tanqiu Jiang Published: 2025-05-16Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 2 |
| CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs Chen-Hsiang Yu, Eric Hanchen Jiang, Mengxue Zhang, Qingcheng Zeng Published: 2025-05-16Area: Safety EvaluationCitations: 16 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 16 |
| LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs Chengzhi Mao, Hao Wang, Ran Li Published: 2025-05-16Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (99%) | 4 |
| Noise Injection Systemically Degrades Large Language Model Safety Guardrails Kaveh Eskandari Miandoab, Matthias Scheutz, Prithviraj Singh Shahani Published: 2025-05-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| Multilingual Collaborative Defense for Large Language Models Changhao Guan, Fengran Mo, Gengping Cui, Hongliang Li Published: 2025-05-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (96%) | - |
| Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets Jiahao Wu, Ke Tang, Ning Lu, Qi Wang Published: 2025-05-17Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |