Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Bypassing Prompt Guards in Production with Controlled-Release Prompting Jaiden Fairoze, Keewoo Lee, Mingyuan Wang, Sanjam Garg Published: 2025-10-02Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (98%) | 1 |
| Dynamic Target Attack Churui Zeng, Di Wang, Kedong Xiu, Kui Ren Published: 2025-10-02Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Machine Learning for Detection and Analysis of Novel LLM Jailbreaks Aditya Pramar, John Hawkins, Rodney Beard, Rohitash Chandra Published: 2025-10-02Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (94%) | 1 |
| Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks Afshin Oroojlooy, Alan Ritter, Dan Roth, Miguel Ballesteros Published: 2025-10-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| UpSafe掳C: Upcycling for Controllable Safety in Large Language Models Hongtao Xie, Kun Yang, Lingyun Yu, Shiwen Cui Published: 2025-10-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (93%) | - |
| Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Shoumik Saha Published: 2025-10-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (94%) | 2 |
| Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach Bo Li, Xiangfang Li, Yu Wang Published: 2025-10-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours Corina S. Pasareanu, Rui Abreu, Rui Melo Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense Dongcheng Zhao, Feifei Zhao, Guobin Shen, Haibo Tong Published: 2025-10-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability Jun Sakuma, Shojiro Yamabe Published: 2025-10-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed Isha Gupta, Joshua Kazdan, Ken Ziyu Liu, Rylan Schaeffer Published: 2025-10-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack Jaewoo Kang, Jungwoo Park, Yein Park Published: 2025-09-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Beyond Linear Probes: Dynamic Safety Monitoring for Language Models Adel Bibi, Fazl Barez, Ioannis Patras, James Oldfield Published: 2025-09-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always! Amir Zadeh, Chuan Li, Jingdi Lei, Rishabh Bhardwaj Published: 2025-09-30Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-30 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 2 |
| SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models Belal Abuhaija, Jiaqi Wang, Kaizhu Huang, Qinjian Zhao Published: 2025-09-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |
| STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents Chao Shang, Devang Kulshreshtha, Hang Su, Jianfeng He Published: 2025-09-30Area: Agent SafetyCitations: 2 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-09-30 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (94%) | 2 |
| STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models Jie Li, Jing Shao, Lijun Li, Shaoxiong Guo Published: 2025-09-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |
| DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models Jiaheng Zhang, Kun Wang, Qingsong Wen, Yitong Zhang Published: 2025-09-29Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 3 |
| Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models Guoan Wan, Huandong Wang, Junyao Gao, Tao Jiang Published: 2025-09-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| SecInfer: Preventing Prompt Injection via Inference-time Scaling Jinyuan Jia, Neil Zhenqiang Gong, Yanting Wang, Yupei Liu Published: 2025-09-29Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 3 |
| Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection Hoang Phan, Qi Lei, Victor Li Published: 2025-09-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning Daqing He, Jiamou Liu, Liehuang Zhu, Meng Li Published: 2025-09-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models Albert No, Dongjae Jeon, Hyesoo Hong, Sangwoo Shin Published: 2025-09-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Dual-Space Smoothness for Robust and Balanced LLM Unlearning Han Yan, Meng Jiang, Zheyuan Liu Published: 2025-09-27Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R3 (93%) | 1 |
| Preventing Robotic Jailbreaking via Multimodal Domain Adaptation Alexander Robey, Christopher Agia, Francesco Marchiori, George J. Pappas Published: 2025-09-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Active Attacks: Red-teaming LLMs via Adaptive Environments Jinkyoo Park, Minsu Kim, Pierre-Luc St-Charles, Taeyoung Yun Published: 2025-09-26Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents Hwan Chang, Hwanhee Lee, Yonghyun Jun Published: 2025-09-26Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 9 |
| Concept-SAE: Active Causal Probing of Visual Model Behavior Chenchen Zhao, Jianrong Ding, Muxi Chen, Qiang Xu Published: 2025-09-26Area: Mechanistic Interp.Citations: - Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | - |
| PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces Jiawei Zhao, Kejiang Chen, Nenghai Yu, Weiming Zhang Published: 2025-09-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| The Rogue Scalpel: Activation Steering Compromises LLM Safety Alexey Dontsov, Andrey Galichin, Anton Korznikov, Elena Tutubalina Published: 2025-09-26Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 4 |