Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLMs Encode Harmfulness and Refusal Separately David Bau, Jiachen Zhao, Jing Huang, Weiyan Shi Published: 2025-07-16Area: Representation AnalysisCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R4 (94%) | 10 |
| Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility Adam Gleave, Brendan Murphy, Dillon Bowen, Julius Broomfield Published: 2025-07-15Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 8 |
| The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs Chaochao Lu, Conghui He, Dongrui Liu, Haoyun Xu Published: 2025-07-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning Chaowei Xiao, Marco Pavone, Somesh Jha, Yingzi Ma Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| PLA: Prompt Learning Attack against Text-to-Image Generative Models Bin Xiao, Xinqi Lyu, Yanjie Li, Yihao Liu Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training Pengfei Du Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | E5 / R3 (95%) | 2 |
| Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers Santhosh Kumar Ravindran Published: 2025-07-12Area: Deception & FailureCitations: 1 Tags: adversarial-robustness, ai-safety, deception-failure, theoretical | 2025-07-12 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, theoretical | E5 / R3 (92%) | 1 |
| One Token to Fool LLM-as-a-Judge Dian Yu, Dong Yu, Haitao Mi, Haolin Liu Published: 2025-07-11Area: Deception & FailureCitations: 34 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-07-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (98%) | 34 |
| SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems Chakkrit Tantithamthavorn, Michael Fu, Rui Yang, Wenliang Shan Published: 2025-07-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2 |
| Defending Against Prompt Injection With a Few DefensiveTokens Chawin Sitawarin, David Wagner, Nicholas Carlini, Sizhe Chen Published: 2025-07-10Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 21 |
| GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing Haibo Jin, Haohan Wang, Liying Kang, Peiyan Zhang Published: 2025-07-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 3 |
| May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks Andrey Labunets, Earlence Fernandes, Nishit V. Pandya, Sicun Gao Published: 2025-07-10Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R4 (95%) | 6 |
| An attention-aware GNN-based input defender against multi-turn jailbreak on LLMs Bowei He, Huiling Zhen, Kecheng Huang, Lihao Yin Published: 2025-07-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks Stephen Obadinma, Xiaodan Zhu Published: 2025-07-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations Jianhao Chen, Mayi Xu, Tieyun Qian, Xiaohu Li Published: 2025-07-08Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation Haoyu Wang, Kailong Wang, Ling Shi, Shuai Yuan Published: 2025-07-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 1 |
| The Bitter Lesson of Misuse Detection Charbel-Rapha毛l Segerie, Diego Dorn, Hadrien Mariaccia Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| TuneShield: Mitigating Toxicity in Conversational AI while Fine-tuning on Untrusted Data Aravind Cheruvu, Bimal Viswanath, Daphne Yao, Murtuza Jadliwala Published: 2025-07-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World Lun Wang, Rajiv Mathews, Soheil Feizi, Vinu Sankar Sadasivan Published: 2025-07-07Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models Jing Shao, Lijun Li, Pengyu Zhu, Yuan Xiong Published: 2025-07-07Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 5 |
| Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message Li Qian, Wei Duan Published: 2025-07-07Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E4 / R3 (95%) | - |
| Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2025-07-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking Aldan Creo, Manuel Cebrian, Raul Castro Fernandez Published: 2025-07-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Adversarial Manipulation of Reasoning Models using Internal Representations Andy Arditi, Benjamin Etheridge, Kureha Yamaguchi Published: 2025-07-03Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users Almog Hilel, Idan Shenfeld, Jacob Andreas, Leshem Choshen Published: 2025-07-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks Arman Zharmagambetov, Chuan Guo, David Wagner, Sizhe Chen Published: 2025-07-03Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 31 |
| PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage Dmitrii Usynin, Krishna Kanth Nakka, Xuebing Zhou, Xue Jiang Published: 2025-07-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 2 |
| ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks Aishan Liu, Dacheng Tao, Siyuan Liang, Zhiyao Ren Published: 2025-07-02Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| MGC: A Compiler Framework Exploiting Compositional Blindness in Aligned LLMs for Malware Generation Guangyu Shen, Lu Yan, Shengwei An, Xiangyu Zhang Published: 2025-07-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | - |
| SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism Beitao Chen, Heng Tao Shen, Jingkuan Song, Lianli Gao Published: 2025-07-02Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (98%) | 3 |