Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking Chong Wang, Wenbo Guo, Xiaojun Jia, Yang Liu Published: 2025-12-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 1 |
| GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs Ahmad-Reza Sadeghi, Lichao Wu, Mohamadreza Rostami, Sasha Behrouzi Published: 2025-12-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 2 |
| Safety Alignment of LMs via Non-cooperative Games Anselm Paulus, Arman Zharmagambetov, Brandon Amos, Ilia Kulikov Published: 2025-12-23Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models Hongru Wei, Linzhi Chen, Yang Sun, Yuqi Chen Published: 2025-12-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| DREAM: Dynamic Red-teaming across Environments for AI Models Jiawei Du, Junyu Huang, Liming Lu, Shuchao Pang Published: 2025-12-22Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models Chenwei Liang, Chen Yang, Hao Yan, Jiayi Gu Published: 2025-12-21Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R2 (94%) | 1 |
| MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking Jianyi Zhang, Shizhao Liu, Zhen Li, Ziyin Zhou Published: 2025-12-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | - |
| Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation Xi Lin, Zehao Liu Published: 2025-12-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Adversarial Robustness of Vision in Open Foundation Models Jonathan Fox, Pavlos Papadopoulos, William J Buchanan Published: 2025-12-19Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | - |
| AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens Hongliang Liu, Tung-Ling Li, Yuhao Wu Published: 2025-12-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models Abhinav Aggarwal, Akash Bharadwaj, Ankit Jain, David Zhang Published: 2025-12-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | - |
| From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda D. Nardi, F. Giarrusso, F. Pierucci, M. Bracale Syrnikov Published: 2025-12-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E5 / R3 (97%) | 1 |
| Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space Pengfei Wang, Xingfu Zhou Published: 2025-12-16Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2 |
| Async Control: Stress-testing Asynchronous Control Measures for LLM Agents Alan Cooney, Arathi Mani, Asa Cooper Stickland, Charlie Griffin Published: 2025-12-15Area: Agent SafetyCitations: 1 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-12-15 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Superposition as Lossy Compression: Measure with Sparse Autoencoders and Connect to Adversarial Vulnerability Efstratios Gavves, Leonard Bereska, Reza Samavi, Zoe Tzifa-Kratira Published: 2025-12-15Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-12-15 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 1 |
| One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs Jun Sakuma, Yixin Tan, Zhe Yu Published: 2025-12-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | - |
| Learning to Extract Context for Context-Aware LLM Inference Alessandro Sordoni, Lucas Caccia, Marc-Alexandre C么t茅, Matheus Pereira Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs Jianbin Jiao, Jing Cui, Junge Zhang, Yufei Han Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring Hao Li, Ning Zhang, Peichun Hua, Shanghao Shi Published: 2025-12-12Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-12 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously Andrew Adiletta, Berk Sunar, Kathryn Adiletta, Kemal Derya Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs Ruimin Sun, Sohely Jahan Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models Abhishek Satyam, Junaid Farooq, Juntao Chen, Ke Chen Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| A Practical Framework for Evaluating Medical AI Security: Reproducible Assessment of Jailbreaking and Privacy Vulnerabilities Across Clinical Specialties Carter Yagemann, Jinghao Wang, Ping Zhang Published: 2025-12-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R4 (97%) | - |
| Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs Jiangyi Deng, Qianhao Miao, Wenyuan Xu, Yanjiao Chen Published: 2025-12-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 1 |
| HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate Shenzhe Zhu Published: 2025-12-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models Richard Young Published: 2025-12-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards Fuli Feng, Moxin Li, Ouxiang Li, Wentao Shi Published: 2025-12-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | - |
| GSAE: Graph-Regularized Sparse Autoencoders for Robust LLM Safety Steering Federico Cinus, Jehyeok Yeon, Luca Luceri, Yifan Wu Published: 2025-12-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation Dongxian Wu, Jie Liao, Qi Guo, Ranjie Duan Published: 2025-12-06Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-12-06 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (98%) | 3 |
| Matching Ranks Over Probability Yields Truly Deep Safety Alignment Gagandeep Singh, Jason Vega Published: 2025-12-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |