Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLM Jailbreak Oracle Alina Oprea, Anshuman Suri, Cheng Tan, Shuyi Lin Published: 2025-06-17Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 3 |
| ROSE: Toward Reality-Oriented Safety Evaluation of Large Language Models Cong Wang, Jiale Ding, Wei-Bin Lee, Xiang Zheng Published: 2025-06-17Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning El Mahdi El Mhamdi, Mathurin Videau, Nicolas Usunier, Wassim Bouaziz Published: 2025-06-17Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (93%) | 4 |
| Mitigating Safety Fallback in Editing-based Backdoor Injection on LLMs Haokai Ma, Houcheng Jiang, Junfeng Fang, Ruipeng Wang Published: 2025-06-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Jailbreak Transferability Emerges from Shared Representations He He, Jannik Brinkmann, Rico Angell Published: 2025-06-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression Amir H. Abdi, Huiqiang Jiang, Lili Qiu, Surin Ahn Published: 2025-06-15Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| Universal Jailbreak Suffixes Are Strong Attention Hijackers Mahmood Sharif, Matan Ben-Tov, Mor Geva Published: 2025-06-15Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025 Aishan Liu, Alan Yuille, Changting Lin, Dacheng Tao Published: 2025-06-14Area: Multimodal SafetyCitations: 10 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R4 (97%) | 10 |
| Understanding and Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding Hang Su, Jun Zhu, Meng Wang, Richang Hong Published: 2025-06-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (97%) | 1 |
| Improving Large Language Model Safety with Contrastive Representation Learning Bernhard Sch枚lkopf, Mrinmaya Sachan, Samuel Simko, Zhijing Jin Published: 2025-06-13Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| InfoFlood: Jailbreaking Large Language Models with Information Overload Advait Yadav, Haibo Jin, Haohan Wang, Jun Zhuang Published: 2025-06-13Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 4 |
| Malicious LLM-Based Conversational AI Makes Users Reveal Personal Information Jose Such, Juan Carlos Carrillo, William Seymour, Xiao Zhan Published: 2025-06-13Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 11 |
| Monitoring Decomposition Attacks in LLMs with Lightweight Sequential Monitors Chen Yueh-Han, He He, Maksym Andriushchenko, Nitish Joshi Published: 2025-06-12Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| SoK: Evaluating Jailbreak Guardrails for Large Language Models Daoyuan Wu, Shuai Wang, Wenxuan Wang, Xunguang Wang Published: 2025-06-12Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, survey | 2025-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E4 / R2 (98%) | 6 |
| DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt Ge Li, Jia Li, Liyi Cai, Yitong Zhang Published: 2025-06-11Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (96%) | 3 |
| From Judgment to Interference: Early Stopping LLM Harmful Outputs via Streaming Content Monitoring Juan Cao, Qiang Sheng, Xueyao Zhang, Yang Li Published: 2025-06-11Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 8 |
| GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models Bo Wang, Xiang Zheng, Xiaosen Wang, Xingjun Ma Published: 2025-06-11Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (95%) | 2 |
| SUA: Stealthy Multimodal Large Language Model Unlearning Attack Delvin Ce Zhang, Dongwon Lee, Hui Liu, Qi He Published: 2025-06-10Area: Model EditingCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-06-10 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 2 |
| Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures Sibei Yang, Wenjie Wang, Yukai Zhou Published: 2025-06-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | 2 |
| Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models Liwei Jiang, Mickel Liu, Natasha Jaques, Simon Shaolei Du Published: 2025-06-09Area: Alignment TrainingCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (98%) | 18 |
| JavelinGuard: Low-Cost Transformer Architectures for LLM Security Sharath Rajasekar, Yash Datta Published: 2025-06-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R6 (98%) | 2 |
| RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards An Zhang, Chenhang Cui, Gelei Deng, Jingnan Zheng Published: 2025-06-09Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 11 |
| Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks Changick Kim, Seokil Ham, Seungju Cho, Younghun Kim Published: 2025-06-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts Alexandra Dmitrienko, Hamid Dashtbani, Torsten Krau脽 Published: 2025-06-09Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 12 |
| When Style Breaks Safety: Defending Language Models Against Superficial Style Alignment Marzyeh Ghassemi, Sana Tonekaboni, Vinith Suriyakumar, Walter Gerych Published: 2025-06-09Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint An Zhang, Changshuo Shen, Junfeng Fang, Leheng Sheng Published: 2025-06-08Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 15 |
| Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations Ramtin Pedarsani, Reza Abbasi-Asl, Zhiyu Xue Published: 2025-06-08Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 1 |
| Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions Dacao Zhang, Guangyi Lv, Kui Yu, Kun Zhang Published: 2025-06-08Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2025-06-08 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 1 |
| HauntAttack: When Attack Follows Reasoning as a Shadow Jingyuan Ma, Junfeng Liu, Lei Sha, Rui Li Published: 2025-06-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 1 |
| Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models Chao Qian, Hao-Tian Li, Ke Xue, Ren-Jian Wang Published: 2025-06-08Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 4 |