Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning Mark Vero, Martin Vechev, Robin Staab, Thibaud Gloaguen Published: 2025-05-22Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-05-22 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E6 / R4 (96%) | - |
| JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models Jingyi Zheng, Mingchen Li, Shengmin Xu, Wenhan Dong Published: 2025-05-23Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-05-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (99%) | 6 |
| One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs Daojing He, Linbao Li, Yannan Liu, Yu Li Published: 2025-05-23Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs Bin Chen, Hao Fang, Jiawei Kong, Kuofeng Gao Published: 2025-05-23Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 3 |
| Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary Jun Zhou, Licheng Pan, Xiaolu Zhang, Xin Zhang Published: 2025-05-23Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Audio Jailbreak Attacks: Exposing Vulnerabilities in SpeechGPT in a White-Box Framework Binhao Ma, Hanqing Guo, Rui Duan, Zhengping Jay Luo Published: 2025-05-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? Bo Han, Chaowei Xiao, Hongzheng Yang, Kun Zhang Published: 2025-05-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | - |
| Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation Gaby G. Dagher, Haibo Jin, Haohan Wang, Jun Zhuang Published: 2025-05-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Safety Alignment via Constrained Knowledge Unlearning Daojing He, Fangming Liu, Jing Li, Jun Yu Published: 2025-05-24Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 6 |
| Security Concerns for Large Language Models: A Survey Benjamin C. M. Fung, Miles Q. Li Published: 2025-05-24Area: Surveys & ReviewsCitations: 29 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-05-24 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E5 / R3 (94%) | 29 |
| An Embarrassingly Simple Defense Against LLM Abliteration Attacks Bernard Ghanem, George Turkiyyah, Harethah Abu Shairah, Hasan Abed Al Kader Hammoud Published: 2025-05-25Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| GhostPrompt: Jailbreaking Text-to-image Generative Models based on Dynamic Optimization Hao Lin, Ke Xu, Tanfeng Sun, Xinghao Jiang Published: 2025-05-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Stronger Enforcement of Instruction Hierarchy via Augmented Intermediate Representations G. Edward Suh, Sanjay Kariyappa Published: 2025-05-25Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Attention! Your Vision Language Model Could Be Maliciously Manipulated Shaokang Wang, Shudong Zhang, Xiaosen Wang, Yuyang Luo Published: 2025-05-26Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 3 |
| Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts Changick Kim, Hee-Seon Kim, Kihyun Kim, Minbeom Kim Published: 2025-05-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | - |
| Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs Chong Zhang, Fangyu Wu, Jia Wang, Xiang Li Published: 2025-05-26Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models Jiaxin Song, Jie Li, Rui Yu, Xingjun Ma Published: 2025-05-26Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (97%) | 3 |
| Learning a Pessimistic Reward Model in RLHF Gagandeep Singh, Hangoo Kang, Tarun Suresh, Yinglun Xu Published: 2025-05-26Area: Alignment TrainingCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Lifelong Safety Alignment for Language Models Chao Du, Haoyu Wang, Min Lin, Tianyu Pang Published: 2025-05-26Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (94%) | 7 |
| Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models Christopher Parisien, Makesh Narsimhan Sreedhar, Traian Rebedea Published: 2025-05-26Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| SGM: A Framework for Building Specification-Guided Moderation Filters Enes Altinisik, Husrev Taha Sencar, Masoomali Fatehkia Published: 2025-05-26Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, tool | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E4 / R3 (95%) | 2 |
| What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs Kimin Lee, Sangyeop Kim, Yohan Lee, Yongwoo Song Published: 2025-05-26Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment Bo Li, Chao Du, Sensen Gao, Simeng Qin Published: 2025-05-27Area: Multimodal SafetyCitations: 20 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-05-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 20 |
| Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space Shouwei Ruan, Xingxing Wei, Yao Huang, Yichi Zhang Published: 2025-05-27Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 10 |
| Concealment of Intent: A Game-Theoretic Analysis Abhishek Umrawal, Lav R. Varshney, Xinbo Wu Published: 2025-05-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | - |
| Red-Teaming Text-to-Image Systems by Rule-based Preference Modeling Xiao-Shan Gao, Yibo Miao, Yichuan Cao, Yinpeng Dong Published: 2025-05-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 2 |
| Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation Anil Ramakrishna, Aram Galstyan, Charith Peris, Kai-Wei Chang Published: 2025-05-27Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-27 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models Ganesh Gopalakrishnan, Harvey Dam, Jonas Knochelmann, Vinu Joseph Published: 2025-05-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance Le Cong, Mengdi Wang, Ruofan Jin, Zaixi Zhang Published: 2025-05-28Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (98%) | 8 |
| Jailbreak Distillation: Renewable Safety Benchmarking Ahmed Elgohary, Ahmed Magooda, A S M Iftekhar, Benjamin Van Durme Published: 2025-05-28Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |