Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Survey of Attacks on Large Language Models Keshab K. Parhi, Wenrui Xu Published: 2025-05-18Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, survey | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (95%) | 10 |
| Improving LLM Outputs Against Jailbreak Attacks With Expert Model Integration Ana Kolkhidashvili, Dachi Kurtskhalia, David Dachi Choladze, Elene Mekvabishvili Published: 2025-05-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression Jiatong Li, Jingyu Peng, Kai Zhang, Maolin Wang Published: 2025-05-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| Self-Destructive Language Model Rongyi Zhu, Ting Wang, Yuhui Wang Published: 2025-05-18Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 8 |
| SPIRIT: Patching Speech Language Models against Jailbreak Attacks Amirbek Djanibekov, Hanan Aldarmaki, Kentaro Inui, Nils Lukas Published: 2025-05-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models Haolin Jin, Huaming Chen, Lei Ma, Linghan Huang Published: 2025-05-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (93%) | 1 |
| Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks Bislan Ashinov, Dmitry Namiot, Narek Maloyan Published: 2025-05-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-05-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 7 |
| Safety Alignment Can Be Not Superficial With Explicit Safety Signals Jianwei Li, Jung-Eun Kim Published: 2025-05-19Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 3 |
| Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners Hiroshi Kera, Soichiro Kumano, Toshihiko Yamasaki Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (93%) | 1 |
| AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models Fu Song, Guangke Chen, Weizhe Zhang, Xiaojun Jia Published: 2025-05-20Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 8 |
| Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models Gang Tan, Md Rafi Ur Rashid, Shagufta Mehnaz, Vishnu Asutosh Dasu Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | 1 |
| "Haet Bhasha aur Diskrimineshun": Phonetic Perturbations in Code-Mixed Hinglish to Red-Team LLMs Darpan Aswal, Siddharth D Jaiswal Published: 2025-05-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs Eyke H眉llermeier, Ivan Habernal, Jiawen Wang, Pritha Gupta Published: 2025-05-20Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 7 |
| PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks Dongcheng Zhao, Guobin Shen, Haibo Tong, Jihang Wang Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 1 |
| SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors Fazl Barez, Maheep Chaudhary Published: 2025-05-20Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| Advancing LLM Safe Alignment with Safety Representation Ranking Chenheng Zhang, Quan Chen, Tianqi Du, Yisen Wang Published: 2025-05-21Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 8 |
| Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen! Hongning Wang, Junxiao Yang, Minlie Huang, Shiyao Cui Published: 2025-05-21Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 2 |
| Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses Bozhidar Stevanoski, Matthieu Meeus, Xiaoxue Yang, Yves-Alexandre de Montjoye Published: 2025-05-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 1 |
| Interpretability Illusions with Sparse Autoencoders Aaron J. Li, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2025-05-21Area: Mechanistic Interp.Citations: 5 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2025-05-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 5 |
| Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval Ang Li, Taiye Chen, Yisen Wang, Zeming Wei Published: 2025-05-21Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 7 |
| Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards Kellin Pelrine, Punya Syon Pandey, Samuel Simko, Zhijing Jin Published: 2025-05-22Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning Baolei Zhang, Biao Yi, Lihai Nie, Li Shen Published: 2025-05-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 8 |
| Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting Bang Trinh Tran To, Thai Le Published: 2025-05-22Area: Model EditingCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (94%) | 4 |
| Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models Cong Tian, Handing Wang, Yaochu Jin, Zhaoxin Wang Published: 2025-05-22Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (97%) | 4 |
| MixAT: Combining Continuous and Discrete Adversarial Training for LLMs Csaba D茅k谩ny, Dimitar I. Dimitrov, Martin Vechev, Robin Staab Published: 2025-05-22Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 5 |
| MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming Daojing He, Jing Li, Jun Yu, Min Zhang Published: 2025-05-22Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E4 / R3 (94%) | 18 |
| Robustifying Vision-Language Models via Dynamic Token Reweighting Fenglong Ma, Jiacheng Liang, Jiawei Zhou, Rongyi Zhu Published: 2025-05-22Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 2 |
| SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning Aosong Feng, Dawn Song, Gaowen Liu, Jayanth Srinivasa Published: 2025-05-22Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 17 |
| SPECTRE: Conditional System Prompt Poisoning to Hijack LLMs Thai Le, Viet Pham Published: 2025-05-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Towards medical AI misalignment: a preliminary study Allan Tucker, Barbara Puccio, Federico Castagna, Pierangelo Veltri Published: 2025-05-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |