Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments Geng Hong, Min Yang, Mi Zhang, Xiaoyu You Published: 2025-08-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning Chaozhuo Li, Lirong Qiu, Litian Zhang, Rui Ha Published: 2025-08-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| A Survey on Data Security in Large Language Models Fan Lin, Jinhe Su, Kang Chen, Li Shen Published: 2025-08-04Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-08-04 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E5 / R3 (95%) | 1 |
| Large Reasoning Models Are Autonomous Jailbreak Agents Erik Derner, Nuria Oliver, Thilo Hagendorff Published: 2025-08-04Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 3 |
| Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models Ruofan Wang, Xingjun Ma, Xin Wang, Xuan Tong Published: 2025-08-03Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| Activation-Guided Local Editing for Jailbreaking Attacks Haohua Du, Hao Peng, Haoran Li, Jiecong Wang Published: 2025-08-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |
| Provably Secure Retrieval-Augmented Generation Pengcheng Zhou, Yinglun Feng, Zhongliang Yang Published: 2025-08-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E6 / R4 (96%) | - |
| Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems Hisashi Kashima, Jiyi Li, Koh Takeuchi, Kyohei Atarashi Published: 2025-07-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs Aditi Raghunathan, Ziqian Zhong Published: 2025-07-31Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Universally Unfiltered and Unseen: Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards Guoliang Yang, Hui Wei, Jinlong Fei, Song Yan Published: 2025-07-30Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking Deyue Zhang, Dongdong Yang, Moyang Chen, Quanchen Zou Published: 2025-07-29Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E16 / R15 (95%) | 3 |
| Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security Hao Sun, Junyu Gao, Muzhi Dai, Shixuan Liu Published: 2025-07-29Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (96%) | 4 |
| Strategic Deflection: Defending LLMs from Logit Manipulation Amal El Fallah Seghrouchni, Faissal Sehbaoui, Jihad Rbaiti, Yassine Rachidy Published: 2025-07-29Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| SDD: Self-Degraded Defense against Malicious Fine-tuning Weikai Lu, Xin Lin, Ziqian Zeng, Zixuan Chen Published: 2025-07-27Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| The Blessing and Curse of Dimensionality in Safety Alignment Laziz U. Abdullaev, Rachel S.Y. Teo, Tan M. Nguyen Published: 2025-07-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models? Chaymaa Abbas, Mariette Awad, Razane Tajeddine Published: 2025-07-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| PurpCode: Reasoning for Safer Code Generation Gang Wang, Hadjer Benkraouda, Haoyu Zhai, Ismini Lourentzou Published: 2025-07-25Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 9 |
| BadReasoner: Planting Tunable Backdoors into Large Reasoning Models for Fun or Profit Biao Yi, Jianing Geng, Lihai Nie, Tong Li Published: 2025-07-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 4 |
| Death by a Thousand Directions: Exploring the Geometry of Harmfulness in LLMs through Subconcept Probing Adhitya Rajendra Kumar, Kevin Zhu, McNair Shah, Naitik Chheda Published: 2025-07-23Area: Representation AnalysisCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-23 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 3 |
| From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models Alicia Parrish, Charvi Rastogi, Jessica Quaye, Lora Aroyo Published: 2025-07-23Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | - |
| Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabilities and Performance Enhancement Opportunities Atil Samancioglu Published: 2025-07-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | - |
| Depth Gives a False Sense of Privacy: LLM Internal States Inversion Guoxing Chen, Haojin Zhu, Shaofeng Li, Tian Dong Published: 2025-07-22Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling Boheng Li, Han Qiu, Jianshuo Dong, Junjie Wang Published: 2025-07-22Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E4 / R3 (96%) | 2 |
| Does More Inference-Time Compute Really Help Robustness? Chawin Sitawarin, Chong Xiang, Jiachen T. Wang, Prateek Mittal Published: 2025-07-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | 3 |
| Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems Andrii Balashov, Olena Ponomarova, Xiaohua Zhai Published: 2025-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | - |
| PromptArmor: Simple yet Effective Prompt Injection Defenses Basel Alomair, Dawn Song, Haonan Wang, Hend Alzahrani Published: 2025-07-21Area: Adversarial RobustnessCitations: 44 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 44 |
| Combining Cost-Constrained Runtime Monitors for AI Safety Aryan Bhatt, Henri Lemoine, James Baskerville, Mia Hopman Published: 2025-07-19Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, theoretical | 2025-07-19 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 9 |
| GIFT: Gradient-aware Immunization of diffusion models against malicious Fine-Tuning with safe concepts retention Amro Abdalla, Bogdan Raita, Dan DeGenaro, Ismail Shaheen Published: 2025-07-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-07-18Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-18 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers Biyu Zhou, Fuqing Zhu, Jizhong Han, Liang Lin Published: 2025-07-17Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |