Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Persona Jailbreaking in Large Language Models Fei Cheng, Jivnesh Sandhan, Tushar Sandhan, Yugo Murawaki Published: 2026-01-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models Fengheng Chu, Jiahao Chen, Jun Wang, Shouling Ji Published: 2026-01-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | - |
| Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs Lana Liu, Mingyu Yu, Sujuan Qin, Wei Wang Published: 2026-01-22Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Feature-Space Adversarial Robustness Certification for Multimodal Large Language Models Chenqi Kong, Meiwen Ding, Song Xia, Wenhan Yang Published: 2026-01-22Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, multimodal-safety, theoretical | 2026-01-22 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, theoretical | E4 / R3 (95%) | - |
| Auditing Language Model Unlearning via Information Decomposition Alan Ritter, Anmol Goel, Iryna Gurevych Published: 2026-01-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| NeuroFilter: Privacy Guardrails for Conversational LLM Agents Ferdinando Fioretto, Saswat Das Published: 2026-01-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking Chengze Yan, Chutian Huang, Dake Cao, Hanhui Xu Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement Aditya Joshi, Anudeex Shetty, Salil S. Kanhere Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift Daniel Vennemeyer, Michael Umeokoli, Phan Anh Duong, Punya Syon Pandey Published: 2026-01-19Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (97%) | - |
| Sockpuppetting: Jailbreaking LLMs Without Optimization Through Output Prefix Injection Asen Dotsinski, Panagiotis Eustratiadis Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning Jun Luo, Xurui Song, Zhixin Xie Published: 2026-01-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| AJAR: Adaptive Jailbreak Architecture for Red-teaming Wang Yang, Yipu Dou Published: 2026-01-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, tool | 2026-01-16 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (97%) | - |
| Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing Daling Wang, Ming Wang, Shi Feng, Xiaocui Yang Published: 2026-01-15Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (95%) | - |
| ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack Chaowei Xiao, G. Edward Suh, Hao Li, Ning Zhang Published: 2026-01-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| The Straight and Narrow: Do LLMs Possess an Internal Moral Path? Hongfei Lin, Jingjie Zeng, Liang Yang, Luoming Hu Published: 2026-01-15Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2026-01-15 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| The Promptware Kill Chain: How Prompt Injections Gradually Evolved Into a Multistep Malware Delivery Mechanism Ben Nassi, Bruce Schneier, Oleg Brodt Published: 2026-01-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, survey | 2026-01-14 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R4 (99%) | - |
| YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation Abdelaziz Bounhar, Guokan Shang, Hadi Abdine, Michalis Vazirgiannis Published: 2026-01-13Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2026-01-13 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (98%) | - |
| Defenses Against Prompt Attacks Learn Surface Heuristics Chaowei Xiao, Charith Peris, Chenxiao Yu, Hao Li Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | - |
| MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP Ruiqi Li, Xiang-Yang Li, Yunhao Yao, Zhiqiang Wang Published: 2026-01-12Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 1 |
| Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety Can Jin, Dimitris N. Metaxas, Hongwu Peng, Jiahui Zhao Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| Safe-FedLLM: Delving into the Safety of Federated Large Language Models Mingxiang Tao, Wenxuan Tu, Xiangyan Tang, Xue Yang Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations Mohammed Aqib Abdullah, Mohammed Himayath Ali, Mohammed Mudassir Uddin, Shahnawaz Alam Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems Ergute Bao, Hongyan Chang, Ting Yu, Xinjian Luo Published: 2026-01-11Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| When Should We Introduce Safety Interventions During Pretraining? Alexander Robey, Dylan Sam, J. Zico Kolter, Pratyush Maini Published: 2026-01-11Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-11 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (92%) | - |
| SafeGPT: Preventing Data Leakage and Unethical Outputs in Enterprise LLM Use Luoxi Tang, Pratyush Desai, Yuqiao Meng, Zhaohan Xi Published: 2026-01-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments Dongpo Cheng, Fangqi Lou, Heng Lian, Huacan Wang Published: 2026-01-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning Daqing He, Jiamou Liu, Jincheng An, Pengtao Kou Published: 2026-01-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models Jun Wang, Ruishi He, Songze Li, Xiaojun Jia Published: 2026-01-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| AM3Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs Chengkun Cai, Chi-Min Chan, Han Zhu, Haoran Li Published: 2026-01-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks Alek Dimitriev, Alex Silverstein, Alwin Peng, Andrew Persic Published: 2026-01-08Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 6 |