Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| 'For Argument's Sake, Show Me How to Harm Myself!': Jailbreaking LLMs in Suicide and Self-Harm Contexts Annika M Schoene, Cansu Canca Published: 2025-07-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | - |
| Reasoning as an Adaptive Defense for Safety Aditi Raghunathan, Aviral Kumar, Fahim Tajwar, Taeyoun Kim Published: 2025-07-01Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 12 |
| SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents Aishan Liu, Ee-Chien Chang, Jinyuan He, Siyuan Liang Published: 2025-07-01Area: Agent SafetyCitations: 5 Tags: adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | 2025-07-01 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | E5 / R4 (95%) | 5 |
| Logit-Gap Steering: Efficient Short-Suffix Jailbreaks for Aligned Large Language Models Hongliang Liu, Tung-Ling Li Published: 2025-06-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 1 |
| STACK: Adversarial Attacks on LLM Safeguard Pipelines Aaron D. Tucker, Adam Gleave, Ian R. McKenzie, Oskar J. Hollinsworth Published: 2025-06-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks Ahmed Salem, Amanda Minnich, Blake Bullwinkel, Daniel Jones Published: 2025-06-29Area: Representation AnalysisCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-06-29 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 2 |
| Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses Alex Park, Gunvanth Kandula, James C. Davis, Mingyu Kim Published: 2025-06-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs Abdul Basit, Boyuan Chen, Minghao Shao, Muhammad Shafique Published: 2025-06-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling Anna Yoo Jeong Ha, Ben Y. Zhao, Haitao Zheng, Ronik Bhaskar Published: 2025-06-27Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-27 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| VERA: Variational Inference Framework for Jailbreaking Large Language Models Anamika Lochab, Lu Yan, Patrick Pynadath, Ruqi Zhang Published: 2025-06-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 1 |
| A Survey on Model Extraction Attacks and Defenses for Large Language Models Kaixiang Zhao, Kaize Ding, Lincan Li, Neil Zhenqiang Gong Published: 2025-06-26Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 11 |
| Probing AI Safety with Source Code Ameet Deshpande, Ashwin Kalyan, Karthik Narasimhan, Shreyas Chaudhari Published: 2025-06-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models Jiacong Hu, Jian Lou, Jiawen Zhang, Kejia Chen Published: 2025-06-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| Report on NSF Workshop on Science of Safe AI Corina P膬s膬reanu, Greg Durrett, Hadas Kress-Gazit, Rajeev Alur Published: 2025-06-24Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-06-24 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R3 (97%) | 1 |
| Security Assessment of DeepSeek and GPT Series Models against Jailbreak Attacks Jianbing Ni, Xiangman Li, Xiaodong Wu Published: 2025-06-23Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 2 |
| Multi-turn Jailbreaking via Global Refinement and Active Fabrication Dawei Yin, Hua Tang, Jizhou Huang, Lingyong Yan Published: 2025-06-22Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (96%) | 1 |
| AI Safety vs. AI Security: Demystifying the Distinction and Boundaries Huan Sun, Ness Shroff, Zhiqiang Lin Published: 2025-06-21Area: Surveys & ReviewsCitations: 2 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E5 / R4 (95%) | 2 |
| Better Language Model Inversion by Compactly Representing Next-Token Distributions John X. Morris, Matthew Finlayson, Murtaza Nazir, Swabha Swayamditta Published: 2025-06-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models Lei Jiang, Liangli Zhen, Xiaobing Sun, Xiaohua Xu Published: 2025-06-20Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R2 (96%) | 2 |
| From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers Jingtong Su, Julia Kempe, Karen Ullrich Published: 2025-06-20Area: Mechanistic Interp.Citations: 3 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-06-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 3 |
| MIST: Jailbreaking Black-box Large Language Models via Iterative Semantic Tuning Changting Lin, Meng Han, Muyang Zheng, Rui Wang Published: 2025-06-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 1 |
| SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification Bingzhe Wu, Chao Fan, Dong Xu, Jianqiang Li Published: 2025-06-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 6 |
| PL-Guard: Benchmarking Language Model Safety for Polish Aleksandra Krasnod臋bska, Karolina Seweryn, Szymon 艁ukasik, Wojciech Kusa Published: 2025-06-19Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models Biao Yi, Sishuo Chen, Tiansheng Huang, Tong Li Published: 2025-06-19Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 24 |
| Probing the Robustness of Large Language Models Safety to Latent Perturbations Jie Li, Kexin Huang, Tianle Gu, Yang Yao Published: 2025-06-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem Datao You, Hongsong Zhu, Peipei Liu, Tiehan Cui Published: 2025-06-18Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, survey | 2025-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R4 (98%) | 7 |
| LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning Gabriel J. Perin, Junyuan Hong, Nina S. T. Hirata, Runjin Chen Published: 2025-06-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts Kartik Sharma, Mahashweta Das, Menghai Pan, Srijan Kumar Published: 2025-06-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions Aishan Liu, Dacheng Tao, Jiakai Wang, Jinyang Guo Published: 2025-06-17Area: Agent SafetyCitations: 13 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-06-17 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E5 / R4 (99%) | 13 |
| FORTRESS: Frontier Risk Evaluation for National Security and Public Safety Christina Q. Knight, Julian Michael, Kaustubh Deshpande, Meher Mankikar Published: 2025-06-17Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 6 |