Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 66 papers (page 1 of 3)路 87 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems Chi Zhang, Feng Chen, Huaixia Dou, Jie Zhu Published: 2026-08-11Area: cs.AICitations: - Tags: ai-safety, csai, preprint, red-teaming | 2026-08-11 | cs.AI | ai-safety, csai, preprint, red-teaming | E13 / R14 (87%) | - |
| GPT-Red: Automated Red Teaming via Self-Play at Scale Aiden Low, Christopher A. Choquette-Choo, Christopher Wolff, Chuan Guo Published: 2026-07-28Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, red-teaming | 2026-07-28 | cs.CR | ai-safety, cscr, preprint, red-teaming | E9 / R7 (92%) | - |
| Code Monitor Red Teaming for Public-Test-Passing Code Fuji Ren, Jiawen Deng, Junchi Liao Published: 2026-07-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, red-teaming | 2026-07-23 | cs.AI | ai-safety, csai, preprint, red-teaming | E11 / R10 (93%) | - |
| TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs Enwei Hu, Junjie Chen, Lili Huang, Qingchao Shen Published: 2026-04-14Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint, red-teaming | 2026-04-14 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint, red-teaming | E4 / R3 (96%) | - |
| Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services Bhaskarjit Sarmah, Fabrizio Dimino, Stefano Pasquali Published: 2026-03-11Area: q-fin.CPCitations: - Tags: ai-safety, preprint, q-fincp, red-teaming | 2026-03-11 | q-fin.CP | ai-safety, preprint, q-fincp, red-teaming | E4 / R3 (95%) | - |
| A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications Kiranmayee Janardhan, Shaurya Jauhari, Shruti Srivastava Published: 2026-02-24Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, red-teaming | 2026-02-24 | cs.CR | ai-safety, cscr, preprint, red-teaming | E10 / R6 (91%) | - |
| Assessing Risks of Large Language Models in Mental Health Support: A Framework for Automated Clinical AI Red Teaming Ian Steenstra, Paola Pedrelli, Stacy Marsella, Timothy W. Bickmore Published: 2026-02-23Area: cs.CLCitations: 206 Tags: ai-safety, cscl, preprint, red-teaming | 2026-02-23 | cs.CL | ai-safety, cscl, preprint, red-teaming | E12 / R13 (91%) | 206 |
| FERRET: Framework for Expansion Reliant Red Teaming Joanna Bitton, Maya Pavlova, Ninareh Mehrabi, Vitor Albiero Published: 2026-02-17Area: cs.CLCitations: 15 Tags: ai-safety, cscl, preprint, red-teaming | 2026-02-17 | cs.CL | ai-safety, cscl, preprint, red-teaming | E12 / R11 (93%) | 15 |
| Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming Abhinav Palia, A. Feder Cooper, Alexandra Chouldechova, Dan Vann Published: 2026-01-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, red-teaming, safety-evaluation, theoretical | 2026-01-26 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, theoretical | E5 / R3 (95%) | 1 |
| RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, red-teaming, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, dataset, red-teaming, safety-evaluation | E5 / R4 (95%) | - |
| The Anatomy of Conversational Scams: A Topic-Based Red Teaming Analysis of Multi-Turn Interactions in LLMs Haoming Tang, Siying Hu, Xiangzhe Yuan, Zhenhao Zhang Published: 2026-01-06Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2026-01-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | - |
| Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models Abhinav Aggarwal, Akash Bharadwaj, Ankit Jain, David Zhang Published: 2025-12-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | - |
| BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing Alexander Warnecke, Caelin Kaplan, Neil Archibald Published: 2025-10-13Area: Safety EvaluationCitations: - Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-10-13 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E7 / R4 (98%) | - |
| AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming Hanbo Song, Keqing He, Kongming Liang, Lulu Zhao Published: 2025-10-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | - |
| Reliable Weak-to-Strong Monitoring of LLM Agents Ankit Aich, Chen Bo Calvin Zhang, Christina Q. Knight, Kevin Zhu Published: 2025-08-26Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, red-teaming, scalable-oversight | 2025-08-26 | Scalable Oversight | ai-safety, empirical, red-teaming, scalable-oversight | E5 / R3 (95%) | 4 |
| Automatic LLM Red Teaming Arunesh Sinha, Pradeep Varakantham, Roman Belaire Published: 2025-08-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-08-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | 1 |
| DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling Boheng Li, Han Qiu, Jianshuo Dong, Junjie Wang Published: 2025-07-22Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E4 / R3 (96%) | 2 |
| PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training Pengfei Du Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | E5 / R3 (95%) | 2 |
| GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models Bo Wang, Xiang Zheng, Xiaosen Wang, Xingjun Ma Published: 2025-06-11Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2025-06-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (95%) | 2 |
| RedDebate: Safer Responses through Multi-Agent Red Teaming Debates Ali Asad, Radin Shayanfar, Stephen Obadinma, Xiaodan Zhu Published: 2025-06-04Area: Safety EvaluationCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R4 (97%) | 3 |
| RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming Cong Wang, Wei-Bin Lee, Xiang Zheng, Xingjun Ma Published: 2025-06-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (97%) | 1 |
| A Red Teaming Roadmap Towards System-Level Safety Christina Q. Knight, Jeremy Kritz, Julian Michael, Willow E. Primack Published: 2025-05-30Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-05-30 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E5 / R3 (92%) | 2 |
| Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs Chetan Pathade Published: 2025-05-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R3 (95%) | 30 |
| The Automation Advantage in AI Red Teaming Ads Dawson, Brad Palm, Brian Greunke, Nick Landers Published: 2025-04-28Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-28 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 2 |
| Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning Ninareh Mehrabi, Rahul Gupta, Ruoxi Jia, Si Chen Published: 2025-04-02Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 9 |
| AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration Andy Zhou, Bo Li, Francesco Pinto, James Zou Published: 2025-03-20Area: Safety EvaluationCitations: 17 Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-03-20 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E5 / R3 (96%) | 17 |
| Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives Aitor Arrieta, Ana B. S谩nchez, Antonia Cazalilla, Jos茅 A. Parejo Published: 2025-03-13Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | 7 |
| RedDiffuser: Red Teaming Vision-Language Models for Toxic Continuation via Reinforced Stable Diffusion Cong Wang, Ruofan Wang, Xiang Zheng, Xiaosen Wang Published: 2025-03-08Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety, red-teaming | 2025-03-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety, red-teaming | E6 / R3 (96%) | - |
| Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models Akshay Gupta, Alberto Purpura, Andy Luo, Jesse Zymet Published: 2025-03-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2025-03-03 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (96%) | 7 |
| UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning Bo Li, Jiawei Zhang, Shuang Yang Published: 2025-02-28Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-02-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E6 / R4 (96%) | 9 |