Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors Bochuan Cao, Changjiang Li, Jinghui Chen, Ting Wang Published: 2025-09-26Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks Dachuan Lin, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-09-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 1 |
| FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction Adel Bibi, Alasdair Paren, Muyang Li, Philip Torr Published: 2025-09-25Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 5 |
| GEP: A GCG-Based method for extracting personally identifiable information from chatbots built on small language models Jieli Zhu, Vi Ngoc-Nha Tran Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b Nils Durner Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| Preemptive Detection and Steering of LLM Misalignment via Latent Reachability Sathwik Karnik, Somil Bansal Published: 2025-09-25Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| RLCracker: Exposing the Vulnerability of LLM Watermarks with Adaptive RL Attacks Hanbo Huang, Hao Zheng, Lin Liu, Shiyu Liang Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization Chongyang Gao, Kaize Ding, Ren Wang, Wenhan Wu Published: 2025-09-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-24 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs Aiying Li, An Zhang, Jiancan Wu, Junkang Wu Published: 2025-09-24Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-09-24 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R3 (94%) | - |
| FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models Chao Du, Jie Li, Tianyu Pang, Xingjun Ma Published: 2025-09-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 1 |
| JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation Md Jueal Mia, M. Hadi Amini Published: 2025-09-24Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (97%) | - |
| LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation Huizhen Shu, Xuying Li, Zhuo Li Published: 2025-09-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models Enguang Liu, Haotian Zhu, Jisheng Dang, Liming Lu Published: 2025-09-24Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Anecdoctoring: Automated Red-Teaming Across Language and Place Alejandro Cuevas, Bharat Kumar Nayak, Dan Vann, Madeleine I. G. Daepp Published: 2025-09-23Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| LLMZ+: Contextual Prompt Whitelist Principles for Agentic LLMs Andy Perkins, Charlotte Crowell, Noorbakhsh Amiri Golilarz, Raj Patel Published: 2025-09-23Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge Hui Dou, Kaibin Wang, Ning Xu, Yiwen Zhang Published: 2025-09-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| DecipherGuard: Understanding and Deciphering Jailbreak Prompts for a Safer Deployment of Intelligent Software Systems Chakkrit Tantithamthavorn, Chetan Arora, Gunel Gulmammadova, Joey Chua Published: 2025-09-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models Jun Jiang, Kejiang Chen, Meng Tong, Nenghai Yu Published: 2025-09-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 1 |
| SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-09-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection Chandru Venkataraman, Francois Kawala, Frank Chu, Haocheng Bian Published: 2025-09-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction Duohe Ma, Tianyun Liu, Tingwen Liu, Yingjie Zhang Published: 2025-09-18Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Evil Vizier: Vulnerabilities of LLM-Integrated XR Systems Erfan Shayegani, Jiasi Chen, Nael Abu-Ghazaleh, Sophie Chen Published: 2025-09-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| LLM Jailbreak Detection for (Almost) Free! Guorui Chen, Jindong Gu, Philip Torr, Xiaojun Jia Published: 2025-09-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 5 |
| Semantic Representation Attack against Aligned Large Language Models Jianhong Pan, Jiawei Lian, Lap-Pui Chau, Lefan Wang Published: 2025-09-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 1 |
| A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks Akif Islam, Jungpil Shin, M. F. Mridha, Mohd Ruhul Ameen Published: 2025-09-16Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models Xiang Zheng, Xingjun Ma, Yunhan Zhao Published: 2025-09-16Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R5 (97%) | - |
| RepIt: Representing Isolated Targets to Steer Language Models Chenguang Wang, Dawn Song, Nathan W. Henry, Nicholas Crispino Published: 2025-09-16Area: Representation AnalysisCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-09-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 4 |
| Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content Arkaitz Zubiaga, Shaz Furniturewala Published: 2025-09-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-09-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E6 / R3 (96%) | - |
| NeuroStrike: Neuron-Level Attacks on Aligned LLMs Ahmad-Reza Sadeghi, Lichao Wu, Maximilian Thang, Mohamadreza Rostami Published: 2025-09-15Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check Bo Han, Chentao Cao, Hang Li, Xiaojun Xu Published: 2025-09-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |