Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Analysis of LLMs Against Prompt Injection and Jailbreak Attacks Aaditya Pratap, Harsh Kasyap, Piyush Jaiswal, Shreyansh Saraswati Published: 2026-02-24Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-02-24 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E17 / R14 (94%) | - |
| SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing Adam Atkinson, Emre K谋c谋man, Guilherme Potje, Leonardo de Oliveira Nunes Published: 2026-02-24Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-02-24 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E11 / R9 (92%) | - |
| TT-SEAL: TTD-Aware Selective Encryption for Adversarially-Robust and Low-Latency Edge AI Jae-Jin Lee, Kyeongpil Min, Sangmin Jeon, Woojoo Lee Published: 2026-02-24Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-02-24 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E10 / R10 (91%) | - |
| Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement Amirhossein Farzam, Guillermo Sapiro, Majid Behabahani, Mani Malek Published: 2026-02-23Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-02-23 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E6 / R5 (94%) | - |
| Modeling Epidemiological Dynamics Under Adversarial Data and User Deception Bud Mishra, Christo Kurisummoottil Thomas, Naren Ramakrishnan, Walid Saad Published: 2026-02-23Area: cs.GTCitations: - Tags: adversarial-robustness, ai-safety, csgt, preprint | 2026-02-23 | cs.GT | adversarial-robustness, ai-safety, csgt, preprint | E9 / R8 (89%) | - |
| When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models Nikhil Chekuru, Shivank Garg, Zachary Guzman, Zafir Shamsi Published: 2026-02-21Area: cs.CLCitations: 45 Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-02-21 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E12 / R9 (94%) | 45 |
| Agentic Adversarial QA for Improving Domain-Specific LLMs Ciprian Tomoiaga, Marcin Detyniecki, Sylvain Lamprier, Tatsunori Hashimoto Published: 2026-02-20Area: cs.CLCitations: 45 Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-02-20 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E9 / R6 (90%) | 45 |
| FENCE: A Financial and Multimodal Jailbreak Detection Dataset Mirae Kim, Seonghun Jeong, Youngjun Kwak Published: 2026-02-20Area: cs.CLCitations: 45 Tags: adversarial-robustness, ai-safety, cscl, preprint | 2026-02-20 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint | E10 / R10 (89%) | 45 |
| On the Adversarial Robustness of Discrete Image Tokenizers Francesco Croce, Irina Rish, Nicolas Flammarion, Rishika Bhagwatkar Published: 2026-02-20Area: cs.CVCitations: - Tags: adversarial-robustness, ai-safety, cscv, preprint | 2026-02-20 | cs.CV | adversarial-robustness, ai-safety, cscv, preprint | E11 / R5 (91%) | - |
| AdvSynGNN: Structure-Adaptive Graph Neural Nets via Adversarial Synthesis and Self-Corrective Propagation Chunlei Meng, Kun Liu, Muge Qi, Rong Fu Published: 2026-02-19Area: cs.LGCitations: - Tags: adversarial-robustness, ai-safety, cslg, preprint | 2026-02-19 | cs.LG | adversarial-robustness, ai-safety, cslg, preprint | E6 / R5 (91%) | - |
| Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis Scott Thornton Published: 2026-02-18Area: cs.CRCitations: 33 Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-02-18 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E11 / R6 (89%) | 33 |
| DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs Justin Albrethsen, Kunal Kumar, Sharath Rajasekar, Yash Datta Published: 2026-02-18Area: cs.AICitations: - Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-02-18 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E9 / R7 (93%) | - |
| IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages Priyaranjan Pattnayak, Sanchari Chowdhuri Published: 2026-02-18Area: cs.AICitations: 1 Tags: adversarial-robustness, ai-safety, csai, preprint | 2026-02-18 | cs.AI | adversarial-robustness, ai-safety, csai, preprint | E10 / R10 (92%) | 1 |
| Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents Doron Shavit Published: 2026-02-18Area: cs.CRCitations: 27 Tags: adversarial-robustness, ai-safety, cscr, preprint | 2026-02-18 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint | E11 / R9 (89%) | 27 |
| AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks Chong Xiang, Neil Zhenqiang Gong, Ruiqi Wang, Xilong Wang Published: 2026-02-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Consistency of Large Reasoning Models Under Multi-Turn Attacks Ramayya Krishnan, Rema Padman, Yubo Li Published: 2026-02-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models Evangelos E. Papalexakis, Sri Durga Sai Sowmya Kadali Published: 2026-02-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Sparse Autoencoders are Capable LLM Jailbreak Mitigators Arno Blaas, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez Published: 2026-02-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | - |
| Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI Mohan Rajagopalan, Vinay Rao Published: 2026-02-11Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, theoretical | 2026-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (99%) | 1 |
| Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away Amrit Singh Bedi, Dinesh Manocha, Furong Huang, Soumya Suvra Ghosal Published: 2026-02-11Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation Franck Dernoncourt, Haoyu Han, Li Ma, Mahantesh Halappanavar Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| Stop Testing Attacks, Start Diagnosing Defenses: The Four-Checkpoint Framework Reveals Where LLM Safety Breaks Hayfa Dhahbi, Kashyap Thimmaraju Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| Towards Poisoning Robustness Certification for Natural Language Generation Matthew Wicker, Mihnea Ghitu Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, theoretical | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | - |
| When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models Alex Jinpeng Wang, Fangming Liu, Haochen Han, Jiacheng Hou Published: 2026-02-10Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing Jona te Lintelo, Lichao Wu, Stjepan Picek Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | - |
| MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks Alina Oprea, Brian Grinstead, Christoph Kerschbaumer, Cristina Nita-Rotaru Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Reinforcement Learning with Backtracking Feedback Bilgehan Sel, Dingcheng Li, Lukas Rutishauser, Ming Jin Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs Hai Huang, Michael Backes, Mingjie Li, Yage Zhang Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Stateless Yet Not Forgetful: Implicit Memory as a Hidden Channel in LLMs Ahmed Salem, Andrew Paverd, Sahar Abdelnabi Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |