Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models Gaotian Liu, Junhua Liu, Kaishuo Wei, Kejia Zhang Published: 2025-11-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization Bo Du, Daiguo Zhou, Mang Ye, Tingfeng Wang Published: 2025-11-17Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs Jie Li, Juncheng Li, Xingjun Ma, Xin Wang Published: 2025-11-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments Cynthia Matuszek, Rebecca Williams, Samuel Nathanson Published: 2025-11-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| AlignTree: Efficient Defense Against LLM Jailbreak Attacks Gil Goren, Lior Wolf, Shahar Katz Published: 2025-11-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| NegBLEURT Forest: Leveraging Inconsistencies for Detecting Jailbreak Attacks Jerome Francois, Lama Sleem, Lujun Li, Nathan Foucher Published: 2025-11-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models Battista Biggio, Fabio Brau, Fabio Roli, Giorgio Piras Published: 2025-11-11Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs Kuofeng Gao, Shu-Tao Xia, Tao Dai, Tao Yu Published: 2025-11-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| A Self-Improving Architecture for Dynamic Safety in Large Language Models Tyler Slater Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (99%) | - |
| Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment Peijie Sun, Peng Zhang Published: 2025-11-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework Kuofeng Gao, Shu-Tao Xia, Tao Dai, Yang Bai Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | - |
| MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs Chaochao Lu, Guangze Ye, Kaicheng Shen, Liang He Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives Chloe Li, Daniel Tan, Mary Phuong Published: 2025-11-10Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-11-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R2 (94%) | 6 |
| EASE: Practical and Efficient Safety Alignment for Small Language Models An Wang, Guoli Wang, Haonan Shi, Tu Ouyang Published: 2025-11-09Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs Hang Su, Jiawei Chen, Shuyuan Liu, Xiao Yang Published: 2025-11-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | - |
| Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies Christopher Parisien, Liwei Jiang, Makesh Narsimhan Sreedhar, Prasoon Varshney Published: 2025-11-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-07 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems Ameya Rathod, Hemang Jain, Ishan Kavathekar, Ponnurangam Kumaraguru Published: 2025-11-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-11-07 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| AdversariaLLM: A Unified and Modular Toolbox for LLM Robustness Research Jakob Steimle, Jonas Dornbusch, Leo Schwinn, Moritz Ladenburger Published: 2025-11-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, tool | 2025-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (96%) | 1 |
| Control Barrier Function for Aligning Large Language Models Masaki Inoue, Yuya Miyaoka Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (96%) | 2 |
| Jailbreaking in the Haystack Aditi Raghunathan, Alexander Robey, Chen Henry Wu, Rishi Rajesh Shah Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (98%) | 2 |
| Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs Aina Sui, Yize Liu, Yunyun Hou Published: 2025-11-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| An Automated Framework for Strategy Discovery, Retrieval, and Evolution in LLM Jailbreak Attacks Guisheng Fan, Hengrun Zhang, Huiqun Yu, Kan Ling Published: 2025-11-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications Baocheng Chen, Haitian Li, Kecheng Wang, Kejiang Chen Published: 2025-11-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| On The Dangers of Poisoned LLMs In Security Automation Even Eilertsen, Patrick Karlsen Published: 2025-11-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (93%) | - |
| Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges Hamin Koo, Jaehyung Kim, Minseon Kim Published: 2025-11-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 1 |
| Do Methods to Jailbreak and Defend LLMs Generalize Across Languages? Berk Atil, Fred Morstatter, Rebecca J. Passonneau Published: 2025-11-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| DRIP: Defending Prompt Injection via De-instruction Training and Residual Fusion Model Architecture Jin Song Dong, Ruofan Liu, Yun Lin, Zhiyong Huang Published: 2025-11-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | - |
| Reimagining Safety Alignment with An Image Guorui Chen, Jindong Gu, Philip Torr, Wenqian Yu Published: 2025-11-01Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-01 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (95%) | 1 |
| ShadowLogic: Backdoors in Any Whitebox LLM Amelia Kawasaki, Kasimir Schulz, Leo Ring Published: 2025-11-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler Dacheng Tao, Li Shen, Yongxian Wei, Zhenyi Wang Published: 2025-10-31Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 3 |