Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Automating Prompt Leakage Attacks on Large Language Models Using Agentic Approach Chi Wang, Davor Runje, Dorian Grano拧a, Tvrtko Sternak Published: 2025-02-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 2 |
| Computational Safety for Generative AI: A Signal Processing Perspective Pin-Yu Chen Published: 2025-02-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, survey | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (96%) | 2 |
| H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking Aolin Ding, Da-Cheng Juan, Hai Li, Jianyi Zhang Published: 2025-02-18Area: Adversarial RobustnessCitations: 77 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (99%) | 77 |
| Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking Dawei Yin, Junda Zhu, Lei Sha, Lingyong Yan Published: 2025-02-18Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 27 |
| Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks Meng Han, Minghao Li, Mohan Li, Wenpeng Xing Published: 2025-02-18Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, survey | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 29 |
| A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos Liang Liu, Lujundong Li, Ruofan Wang, Xuan Tong Published: 2025-02-19Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 27 |
| Efficient Safety Retrofitting Against Jailbreaking for LLMs Adrian Tormos, Anna Arias-Duart, Ashwin Kumar Gururajan, Daniel Hinjos Published: 2025-02-19Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region Chak Tou Leong, Jian Wang, Qingyu Yin, Wenjie Li Published: 2025-02-19Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (93%) | 6 |
| EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models Devashri Naik, Dinithi Jayasuriya, Nastaran Darabi, Ranganath Krishnan Published: 2025-02-20Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 2 |
| Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs Alexandra Souly, Christian Schroeder de Witt, Eric Winsor, Robert Kirk Published: 2025-02-20Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 11 |
| HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States Bo Zheng, Tianshuo Peng, Xiangyu Yue, Xiaoyong Zhu Published: 2025-02-20Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 22 |
| How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation Shujun Liu, Siyuan Wang, Xuanjing Huang, Yuhang Lai Published: 2025-02-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs Ambrish Rawat, Beat Buesser, Giandomenico Cornacchia, Giulio Zizzo Published: 2025-02-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 12 |
| Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh, Pedram Zaree Published: 2025-02-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders Jiayi Yuan, Ninghao Liu, Wenlin Yao, Xiaoming Zhai Published: 2025-02-21Area: Mechanistic Interp.Citations: 20 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-02-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R4 (93%) | 20 |
| SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention Chen Chen, Chunyan Hou, Jiaqi Wu, Xiaojie Yuan Published: 2025-02-21Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Single-pass Detection of Jailbreaking Input in Large Language Models Elias Abad Rocamora, Grigorios G. Chrysos, Leyla Naz Candogan, Volkan Cevher Published: 2025-02-21Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 7 |
| A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens David Dobre, Gauthier Gidel, Leo Schwinn, Mehrnaz Mohfakhami Published: 2025-02-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Efficient LLM Moderation with Multi-Layer Latent Prototypes Bartosz W贸jcik, Filip Szatkowski, Jan Dubi艅ski, Maciej Chrab膮szcz Published: 2025-02-22Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Merger-as-a-Stealer: Stealing Targeted PII from Aligned LLMs with Model Merging Lin Lu, Pan Zhou, Zhigang Zuo, Ziji Sheng Published: 2025-02-22Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 1 |
| Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs Chen Chen, Peng Yifeng, Wu Zhizheng Published: 2025-02-23Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 1 |
| GuidedBench: Equipping Jailbreak Evaluation with Guidelines Daoyuan Wu, Ruixuan Huang, Shuai Wang, Xunguang Wang Published: 2025-02-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective Johannes Gasteiger, M. H. I. Abdalla, Simon Geisler, Stephan G眉nnemann Published: 2025-02-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 10 |
| Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs Ansen Zhang, Ronghao Chen, Shiyu Xiang, Yanfei Cao Published: 2025-02-26Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 10 |
| JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models Haoran Bu, Shuyi Liu, Simiao Cui, Xi Zhang Published: 2025-02-26Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 2 |
| No, of course I can! Refusal Mechanisms Can Be Exploited Using Harmless Fine-Tuning Data Chris Cundy, Joshua Kazdan, Krishnamurthy Dvijotham, Lisa Yu Published: 2025-02-26Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (99%) | 6 |
| One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs Arman Cohan, Jacob Dunefsky Published: 2025-02-26Area: Representation AnalysisCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-02-26 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (94%) | 9 |
| Shh, don't say that! Domain Certification in LLMs Adel Bibi, Alasdair Paren, Bernard Ghanem, Cornelius Emde Published: 2025-02-26Area: Formal/TheoreticalCitations: 4 Tags: adversarial-robustness, ai-safety, formaltheoretical, theoretical | 2025-02-26 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, theoretical | E5 / R3 (93%) | 4 |
| Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents Daniel Kang, Henil Shalin Panchal, Qiusi Zhan, Richard Fang Published: 2025-02-27Area: Adversarial RobustnessCitations: 52 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 52 |
| Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models Jiaxing Song, Qi Li, Sibo Yi, Tianshuo Cong Published: 2025-02-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | 1 |