Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Foot-In-The-Door: A Multi-turn Jailbreak for LLMs Jinyuan Jia, Xiangyu Zhang, Xiaolong Jin, Zixuan Weng Published: 2025-02-27Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 20 |
| FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts Jihui Guo, Xinlei He, Zhen Sun, Ziyi Zhang Published: 2025-02-28Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 5 |
| Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks Alexander Robey, Changliu Liu, Hanjiang Hu Published: 2025-02-28Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 11 |
| UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning Bo Li, Jiawei Zhang, Shuang Yang Published: 2025-02-28Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E6 / R4 (96%) | 9 |
| Adaptively profiling models with task elicitation Davis Brown, Eric Wong, Hamed Hassani, Helen Jin Published: 2025-03-03Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-03-03 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Jailbreaking Safeguarded Text-to-Image Models via Large Language Models Neil Zhenqiang Gong, Yinzhi Cao, Yuchen Yang, Yuepeng Hu Published: 2025-03-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (95%) | 2 |
| LLM Misalignment via Adversarial RLHF Platforms Ali Naseh, Erfan Entezami Published: 2025-03-04Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (94%) | 3 |
| E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models Aishan Liu, Haotian Zhu, Liming Lu, Shuchao Pang Published: 2025-03-05Area: Multimodal SafetyCitations: 16 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 16 |
| Geometry-Guided Adversarial Prompt Detection via Curvature and Local Intrinsic Dimension Canaan Yung, Christopher Leckie, Hanxun Huang, Sarah Monazam Erfani Published: 2025-03-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 1 |
| Improving LLM Safety Alignment with Dual-Objective Optimization David Huang, Dawn Song, Licong Lin, Song Mei Published: 2025-03-05Area: Alignment TrainingCitations: 22 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-05 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 22 |
| One-Shot is Enough: Consolidating Multi-Turn Attacks into Efficient Single-Turn Prompts for LLMs Ashkan Yousefpour, Haon Park, Hyunjun Kim, Junwoo Ha Published: 2025-03-06Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 11 |
| Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety Ding Zhao, Miao Li, William Han, Yihang Yao Published: 2025-03-06Area: Alignment TrainingCitations: 21 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-03-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 21 |
| Jailbreaking is (Mostly) Simpler Than You Think Ahmed Salem, Mark Russinovich Published: 2025-03-07Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 2 |
| CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models Jiaxu Liu, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2025-03-08 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E5 / R4 (96%) | - |
| Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models Boussad Addad, Katarzyna Kapusta, Thomas Winninger Published: 2025-03-08Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-03-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E6 / R3 (96%) | 3 |
| PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models Aakriti Agrawal, Bang An, Furong Huang, Michael-Andrei Panaitescu-Liess Published: 2025-03-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Safety Guardrails for LLM-Enabled Robots Alexander Robey, George J. Pappas, Hamed Hassani, Vijay Kumar Published: 2025-03-10Area: Agent SafetyCitations: 22 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-03-10 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (95%) | 22 |
| Utilizing Jailbreak Probability to Attack and Safeguard Multimodal LLMs Deyue Zhang, Dongdong Yang, Quanchen Zou, Wenzhuo Xu Published: 2025-03-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (95%) | - |
| Backtracking for Safety Bilgehan Sel, Dingcheng Li, Ming Jin, Phillip Wallis Published: 2025-03-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Chain-of-Thought Reasoning In The Wild Is Not Always Faithful Arthur Conmy, Ivan Arcuschin, Jett Janiak, Neel Nanda Published: 2025-03-11Area: Deception & FailureCitations: 98 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-03-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E6 / R3 (96%) | 98 |
| Dialogue Injection Attack: Jailbreaking LLMs Through Context Manipulation Chengkun Wei, Fan Zhang, Wendao Yao, Wenlong Meng Published: 2025-03-11Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 8 |
| Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks Vasudev Gohil Published: 2025-03-12Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States Chia, Jonathan, Pan, Xin Wei Published: 2025-03-12Area: Representation AnalysisCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-03-12 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 4 |
| ASIDE: Architectural Separation of Instructions and Data in Language Models Alexander Panfilov, Alexandra Volkova, Christoph H. Lampert, Egor Zverev Published: 2025-03-13Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 10 |
| ExtremeAIGC: Benchmarking LMM Vulnerability to AI-Generated Extremist Content Bhavik Chandna, Mariam Aboujenane, Usman Naseem Published: 2025-03-13Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E6 / R3 (95%) | 1 |
| MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents Adel Bibi, Alasdair Paren, Lukas Aichberger, Philip Torr Published: 2025-03-13Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (98%) | 8 |
| Policy Teaching via Data Poisoning in Learning from Human Preferences Adish Singla, Andi Nika, Debmalya Mandal, Goran Radanovi膰 Published: 2025-03-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2025-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 1 |
| TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models Jinwei Hu, Wenjie Ruan, Xiangyu Yin, Xiaowei Huang Published: 2025-03-13Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (95%) | 2 |
| Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks Guozhu Meng, Kai Chen, Tong Liu, Yingjie Zhang Published: 2025-03-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-03-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization Bryan Hooi, Jun Liu, Muhao Chen, Shuyang Hao Published: 2025-03-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (96%) | 1 |