Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation Marco Canini, Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi Published: 2026-02-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Robustness of Vision Language Models Against Split-Image Harmful Input Attacks Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Shagufta Mehnaz, Vishnu Asutosh Dasu Published: 2026-02-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| NAAMSE: Framework for Evolutionary Security Evaluation of Agents Harshil Patel, Kunal Pai, Parth Shah Published: 2026-02-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2026-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (93%) | - |
| Agentic Uncertainty Reveals Agentic Overconfidence Gb猫tondji Dovonon, Jean Kaddour, Leo Richter, Matt J. Kusner Published: 2026-02-06Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2026-02-06 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| Extended to Reality: Prompt Injection in 3D Environments Ying Chen, Zhuoheng Li Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective Cheol Woo Kim, Davin Choo, Milind Tambe, Tzeh Yuan Neoh Published: 2026-02-06Area: Formal/TheoreticalCitations: - Tags: adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | 2026-02-06 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | E5 / R3 (93%) | - |
| Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Qian Wang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |
| SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks Chenliang Xu, Jialin Song, Jianfeng Gao, Mingqian Feng Published: 2026-02-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| ShallowJail: Steering Jailbreaks against Large Language Models Hanyu Pei, Shang Liu, Zeyan Liu Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (97%) | - |
| TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking Mengyu Wang, Minda Zhao, Ruizhi Qian, Sung-Hoon Yoon Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |
| TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking Ee-Chien Chang, Gang Yang, Han Fang, Haokai Ma Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems Shangbin Feng, Wenxuan Ding, Yulia Tsvetkov, Ziyuan Yang Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (93%) | - |
| BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models Guowen Xu, Hongwei Li, Rui Zhang, Wenbo Jiang Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Clouding the Mirror: Stealthy Prompt Injection Attacks Targeting LLM-based Phishing Detection Daiki Chiba, Hiroki Nakano, Takashi Koide Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | - |
| GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt Ahmed Salem, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Learning to Inject: Automated Prompt Injection via Reinforcement Learning Florian Tram猫r, Jie Zhang, Xin Chen Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop Patryk Rybak, Paul Swoboda, Pawe艂 Batorski, Przemys艂aw Spurek Published: 2026-02-05Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-05 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink Guozhi Liu, Li Shen, Qi Mu, Ruichao Mo Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks Jafar Isbarov, Murat Kantarcioglu Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks Jingjing He, Shuaishuai Yang, Tong Yang, Yanshu Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (93%) | - |
| RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning Qiaosheng Zhang, Xia Hu, Xingcheng Xu, Zeming Wei Published: 2026-02-04Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Trust The Typical Alan Luo, Biyao Zhang, Debargha Ganguly, Harshini Kavuru Published: 2026-02-04Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models Fadi Hassan, Hicham Eddoubi, Umar Faruk Abdullahi Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (98%) | - |
| LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios Chujia Hu, Dongrui Liu, Ge Gao, Tianyu Chen Published: 2026-02-03Area: Agent SafetyCitations: 1 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2026-02-03 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E4 / R3 (95%) | 1 |
| Phantom Transfer: Data-level Defences are Insufficient Against Data Poisoning Anandmayi Bhongade, Andrew Draganov, Mary Phuong, Tolga H. Dur Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility Gang Xu, Hongjie Jiang, Mengxuan Wang, Ming Li Published: 2026-02-03Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Semantic-level Backdoor Attack against Text-to-Image Diffusion Models Cheng Huang, Hongqiao Chen, Tianxin Chen, Wenbo Jiang Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models Chen Xiong, Ching-Yun Ko, Pin-Yu Chen, Tsung-Yi Ho Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | - |