Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models Badhan Chandra Das, Joaquin Molto, Md Tasnim Jawad, M. Hadi Amini Published: 2026-01-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation Dazhen Deng, Huawei Zheng, Sen Yang, Shouling Ji Published: 2026-01-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification Gaotang Li, Hanghang Tong, Philip Li, Tianxin Wei Published: 2026-01-07Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning Haibo Hu, Minxin Du, Peizhao Hu, Qingqing Ye Published: 2026-01-07Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-07 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense Haoyu Li, Jianhua Li, Jun Wu, Siyuan Li Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R5 (96%) | - |
| How Does the Thinking Step Influence Model Safety? An Entropy-based Safety Reminder for LRMs Hyundong Jin, Su-Hyeon Kim, Yejin Lee, Yo-Sub Han Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defenses Chao Li, Chaozhuo Li, Litian Zhang, Xi Zhang Published: 2026-01-07Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2026-01-07 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E6 / R4 (97%) | 1 |
| Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models Gary Geunbae Lee, San Kim Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| MiJaBench: Revealing Minority Biases in Large Language Models via Hate Speech Jailbreaking Arlindo R. Galv茫o Filho, Diogo F. C. Silva, Iago A. Brito, Julia S. Dollis Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-07 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R3 (95%) | - |
| STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules Bing Qin, Di Wu, Mingzhe Li, Xin Lu Published: 2026-01-07Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (99%) | 1 |
| Adversarial Contrastive Learning for LLM Quantization Attacks Dinghong Song, Dong Li, Hai Wan, Pengfei Su Published: 2026-01-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models Qin Hu, Xiangdong Hu, Xiaojun Jia, Yangyang Jiang Published: 2026-01-06Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-06 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | - |
| Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks Florian Bernard, Frank R. Schmidt, Zhakshylyk Nurlanov Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification Baosheng Wang, Bin Ji, Jie Yu, Shasha Li Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Learning to Diagnose and Correct Moral Errors: Towards Enhancing Moral Sensitivity in Large Language Models Bocheng Chen, Guangliang Liu, Han Zi, Kristen Johnson Published: 2026-01-06Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms Jun Sun, Ruihan Zhang Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering Scott Thornton Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization Haibo Jin, Haohan Wang, Jiwei Guan Published: 2026-01-05Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (98%) | - |
| How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference Chaozhuo Li, Chenxu Wang, Litian Zhang, Rui Pu Published: 2026-01-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns Chuanpu Liu, Kun Wang, Qiankun Li, Shilinlu Yan Published: 2026-01-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-02 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R5 (96%) | - |
| ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Patching Bin Chen, Hongyan Li, Junhao Li, Xinhao Zhong Published: 2026-01-01Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-01 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak Handing Wang, Haoran Gu, Mengjie Zhang, Yaochu Jin Published: 2026-01-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2026-01-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E4 / R2 (95%) | - |
| Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs Muhammad Abdullahi Said, Muhammad Sammani Sani Published: 2025-12-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | - |
| The Trojan in the Vocabulary: Stealthy Sabotage of LLM Composition Jing Gao, Matt Fredrikson, Weichen Yu, Xiaoqian Wang Published: 2025-12-31Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race? Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang Published: 2025-12-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation Kaustubh Dhole Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion Hai Huang, Zhengkui Chen, Zhen Liang Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents Adam Mahdi, Adel Bibi, Arkadiusz Drohomirecki, Chris Russell Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | - |
| Few Tokens Matter: Entropy Guided Attacks on Vision-Language Models Jing Zhang, Jinhong Ni, Mengqi He, Shu Zou Published: 2025-12-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs Beibei Li, Bing Ji, Jiangwei Xia, Jiayu Hu Published: 2025-12-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |