Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models Fan Yang Published: 2025-12-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations Chi Zhang, Huilin Zhou, Jian Zhao, Tianle Zhang Published: 2025-12-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack Hui Xue, Jialing Tao, Jin Yan, Jiyang Guan Published: 2025-12-05Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (98%) | - |
| SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security Jun Sun, Wei Zhao, Zhe Li Published: 2025-12-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (95%) | - |
| Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs Daojing He, Jiaqi Yao, Shaohui Liu, Shihao Peng Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| From static to adaptive: immune memory-based jailbreak detection for large language models Jun Leng, Litian Zhang, Ruihan Hu, Xi Zhang Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| In-Context Representation Hijacking Amir Sarid, Itay Yona, Michael Karasik, Yossi Gandelsman Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities Chen Qian, Jie Li, Jing Shao, Lijun Li Published: 2025-12-02Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |
| Invasive Context Engineering to Control Large Language Models Thomas Rivasseau Published: 2025-12-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-12-02 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | - |
| DefenSee: Dissecting Threat from Sight and Text - A Multi-View Defensive Pipeline for Multi-modal Jailbreaks Kar-Wai Fok, Vrizlynn L. L. Thing, Zihao Wang Published: 2025-12-01Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search Eli Chien, Olgica Milenkovic, Pan Li, Peizhi Niu Published: 2025-12-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (98%) | 1 |
| Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis Bo Li, Chaowei Xiao, Chong Xiang, Edward Suh Published: 2025-11-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 1 |
| Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li Published: 2025-11-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines Dongyuan Lu, Jitao Sang, Yanxu Zhu, Yuhang Wang Published: 2025-11-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models David Mohaisen, Trung Cuong Dang Published: 2025-11-25Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 2 |
| On the Feasibility of Hijacking MLLMs' Decision Chain via One Perturbation Changyue Li, Jiaming He, Jiaying Li, Pinjia He Published: 2025-11-25Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization Haixu Tang, Kaisong Song, Pin-Yu Chen, Rui Zhu Published: 2025-11-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 2 |
| Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion Cong Zuo, Haibin Zhang, Hang Fu, Licheng Wang Published: 2025-11-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models Enes Altinisik, Husrev Taha Sencar, Masoomali Fatehkia Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation Benyamin Tafreshian Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM Adarsh Kumarappan, Ayushi Mehrotra Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R3 (95%) | - |
| TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization Jinghui Chen, Jinyuan Jia, Minhao Cheng, Runpeng Geng Published: 2025-11-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| ASTRA: Agentic Steerability and Risk Assessment Framework Guy Shtar, Itay Hazan, Itsik Mantin, Ron Bitton Published: 2025-11-22Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-11-22 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E5 / R3 (96%) | - |
| Evaluating Adversarial Vulnerabilities in Modern Large Language Models Tom Perel Published: 2025-11-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | - |
| Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models Joseph Gardiner, Sana Belguith, Stanislav Abaimov, Zhiyuan Xu Published: 2025-11-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| AutoBackdoor: Automating Backdoor Attacks via LLM Agents Hanxun Huang, Jun Sun, Nay Myat Min, Wei Zhao Published: 2025-11-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (95%) | 1 |
| Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security Jun Sun, Wei Zhao, Yige Li, Zhe Li Published: 2025-11-20Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (97%) | 1 |
| Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models D. Nardi, F. Giarrusso, F. Pierucci, F. Sartore Published: 2025-11-19Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 8 |
| Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks Daoyuan Wu, Pingchuan Ma, Shuai Wang, Tian Tian Published: 2025-11-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E6 / R3 (95%) | - |
| Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education Dongsheng Shi, Liang He, Linlin Wang, Xiaoling Wang Published: 2025-11-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |