Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| OverThink: Slowdown Attacks on Reasoning LLMs Abhinav Kumar, Ali Naseh, Amir Houmansadr, Eugene Bagdasarian Published: 2025-02-04Area: Adversarial RobustnessCitations: 60 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 60 |
| PANDAS: Improving Many-shot Jailbreaking via Positive Affirmation, Negative Demonstration, and Adaptive Sampling Amir-massoud Farahmand, Avery Ma, Yangchen Pan Published: 2025-02-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| STAIR: Improving Safety Alignment with Introspective Reasoning Dong Yan, Jun Zhu, Ranjie Duan, Siyuan Zhang Published: 2025-02-04Area: Alignment TrainingCitations: 48 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 48 |
| Position: Editing Large Language Models Poses Serious Safety Risks Christin Seifert, Daniel Braun, Jorg Schlotterer, Paul Youssef Published: 2025-02-05Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, position | 2025-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E6 / R3 (95%) | 15 |
| Understanding and Enhancing the Transferability of Jailbreaking Attacks Bo Han, Fengwang Li, Runqi Lin, Tongliang Liu Published: 2025-02-05Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 18 |
| A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluation Methods Qingchuan Zhao, Tao Ni, Wei-Bin Lee, Yihe Zhou Published: 2025-02-06Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 24 |
| Leveraging Reasoning with Guidelines to Elicit and Utilize Knowledge for Enhancing Safety Alignment Dacheng Tao, Haoyu Wang, Li Shen, Minhao Cheng Published: 2025-02-06Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 10 |
| "Short-length" Adversarial Training Helps LLMs Defend "Long-length" Jailbreak Attacks: Theoretical and Empirical Evidence Di Wang, Liang Ding, Shaopeng Fu Published: 2025-02-06Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions Marzyeh Ghassemi, Narutatsu Ri, Yik Siu Chan, Yuxin Xiao Published: 2025-02-06Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 13 |
| MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents Jindong Wang, Kaijie Zhu, Wenbo Guo, William Yang Wang Published: 2025-02-07Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 24 |
| Jailbreaking to Jailbreak Bijan Varjavand, Bobby Gogov, Jeremy Kritz, Michael Choi Published: 2025-02-09Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 7 |
| JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation Chao Shen, Cong Wang, Hongxin Hu, Keyan Guo Published: 2025-02-11Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 34 |
| LUNAR: LLM Unlearning via Neural Activation Redirection Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-02-11Area: Model EditingCitations: 17 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-02-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (97%) | 17 |
| MetaSC: Test-Time Safety Specification Optimization for Language Models V铆ctor Gallego Published: 2025-02-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Universal Adversarial Attack on Aligned Multimodal LLMs Andrey Kuznetsov, Anton Razzhigaev, Matvey Mikhalchuk, Polina Druzhinina Published: 2025-02-11Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| Commercial LLM Agents Are Already Vulnerable to Simple Yet Dangerous Attacks Ang Li, Micah Goldblum, Tom Goldstein, Vethavikashini Chithrra Raghuram Published: 2025-02-12Area: Agent SafetyCitations: 38 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-02-12 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E6 / R3 (96%) | 38 |
| Jailbreak Attack Initializations as Extractors of Compliance Directions Amit Levi, Avi Mendelson, Chaim Baskin, Rom Himelstein Published: 2025-02-13Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 5 |
| QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language Jingyu Xiao, Kuofeng Gao, Li Xu, Qing Li Published: 2025-02-13Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 9 |
| The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions Haining Yu, Qiguang Chen, Wenbo Pan, Xiangyang Zhou Published: 2025-02-13Area: Mechanistic Interp.Citations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | 2025-02-13 | Mechanistic Interp. | adversarial-robustness, ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | 8 |
| Fast Proxies for LLM Robustness Evaluation Jan Schuchardt, Leo Schwinn, Stephan G眉nnemann, Tim Beyer Published: 2025-02-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability Dongrui Liu, Jing Shao, Luxin Xu, Xiaoya Lu Published: 2025-02-14Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 13 |
| A Closer Look at System Prompt Robustness David Wagner, Jonathan Lu, Michael Lavery, Norman Mu Published: 2025-02-15Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 17 |
| Distraction is All You Need for Multimodal Large Language Model Jailbreaking Anli Yan, Changyu Dong, Erdun Gao, Jiluan Fan Published: 2025-02-15Area: Multimodal SafetyCitations: 23 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 23 |
| SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks Boyan Wang, Chao Deng, Fan Feng, Fanyu Meng Published: 2025-02-16Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 18 |
| To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models Baoyuan Wu, Hongbao Zhang, Ke Xu, Ruotong Wang Published: 2025-02-16Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (99%) | 13 |
| Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives Gauthier Gidel, Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann Published: 2025-02-17Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, position | 2025-02-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, position | E4 / R3 (94%) | 7 |
| Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang Published: 2025-02-17Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-02-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 6 |
| DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing Fenghua Weng, Minlie Huang, Sibei Yang, Wenjie Wang Published: 2025-02-17Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-02-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 6 |
| SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities Bill Yuchen Lin, Bo Li, Fengqing Jiang, Luyao Niu Published: 2025-02-17Area: Safety EvaluationCitations: 88 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 88 |
| StructTransform: A Scalable Attack Surface for Safety-Aligned Large Language Models Ahmed Lekssays, Issa Khalil, Mashael AlSabah, Shehel Yoosuf Published: 2025-02-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 1 |