Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 66 papers (page 1 of 3)路 44 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Red Teaming Language Models with Language Models Amelia Glaese, Ethan Perez, Francis Song, Geoffrey Irving Published: 2022-02-07Area: Safety EvaluationCitations: 919 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2022-02-07 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 919 |
| Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-08-23Area: Safety EvaluationCitations: 675 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2022-08-23 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 675 |
| Red Teaming with Mind Reading: White-Box Adversarial Policies Against RL Agents Dylan Hadfield-Menell, Gabriel Kreiman, Stephen Casper, Taylor Killian Published: 2022-09-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | 1 |
| Can Large Language Models Change User Preference Adversarially? Varshini Subhash Published: 2023-01-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-01-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 9 |
| Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity Chunyang Chen, Terry Yue Zhuo, Yujin Huang, Zhenchang Xing Published: 2023-01-30Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R5 (96%) | 137 |
| Red Teaming Deep Neural Networks with Feature Synthesis Tools Dylan Hadfield-Menell, Jiawei Li, Kaivalya Hariharan, Kevin Zhang Published: 2023-02-08Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | 2023-02-08 | Safety Evaluation | ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | E6 / R3 (96%) | 21 |
| Query-Efficient Black-Box Red Teaming via Bayesian Optimization Deokjae Lee, Hwaran Lee, Hyun Oh Song, Jin-Hwa Kim Published: 2023-05-27Area: Safety EvaluationCitations: 31 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-05-27 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 31 |
| Explore, Establish, Exploit: Red Teaming Language Models from Scratch Dylan Hadfield-Menell, Gatlen Culp, Jason Lin, Joe Kwon Published: 2023-06-15Area: Safety EvaluationCitations: 125 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 125 |
| FLIRT: Feedback Loop In-context Red Teaming Aram Galstyan, Christophe Dupuy, Kai-Wei Chang, Ninareh Mehrabi Published: 2023-08-08Area: Safety EvaluationCitations: 93 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-08-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 93 |
| Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities Bennett Kleinberg, Lewis D. Griffin, Maximilian Mozes, Xuanli He Published: 2023-08-24Area: Safety EvaluationCitations: 113 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | 2023-08-24 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | E5 / R4 (95%) | 113 |
| GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts Jiahao Yu, Xingwei Lin, Xinyu Xing, Zheng Yu Published: 2023-09-19Area: Adversarial RobustnessCitations: 537 Tags: adversarial-robustness, ai-safety, red-teaming, tool | 2023-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, red-teaming, tool | E5 / R3 (97%) | 537 |
| Red Teaming Game: A Game-Theoretic Framework for Red Teaming Language Models Chengdong Ma, Hai Ci, Jun Gao, Minquan Gao Published: 2023-09-30Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 13 |
| Attack Prompt Generation for Red Teaming and Defending Large Language Models Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang Published: 2023-10-19Area: Adversarial RobustnessCitations: 92 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 92 |
| JAB: Joint Adversarial Prompting and Belief Augmentation Anil Ramakrishna, Aram Galstyan, Jwala Dhamala, Kai-Wei Chang Published: 2023-11-16Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E6 / R3 (96%) | 8 |
| HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Andy Zou, Bo Li, Dan Hendrycks, David Forsyth Published: 2024-02-06Area: Safety EvaluationCitations: 830 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-02-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (95%) | 830 |
| ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-04-06Area: Safety EvaluationCitations: 83 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-04-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E4 / R3 (96%) | 83 |
| STAR: SocioTechnical Approach to Red Teaming Language Models Bernat Guill茅n Pegueroles, Canfer Akbulut, John Mellor, Kristian Lum Published: 2024-06-17Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-06-17 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 16 |
| Automated Progressive Red Teaming Bojian Jiang, Deyi Xiong, Qing Yang, Tianhao Shen Published: 2024-07-04Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E8 / R5 (96%) | 11 |
| Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts Chengjun Cai, Cong Wang, Xiaoli Zhang, Xingliang Yuan Published: 2024-07-21Area: Multimodal SafetyCitations: 38 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2024-07-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (96%) | 38 |
| RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent Feng Xiao, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-07-23Area: Safety EvaluationCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 30 |
| Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh Published: 2024-08-20Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-08-20 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R4 (95%) | 6 |
| Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI Ambrish Rawat, Beat Buesser, Elizabeth M. Daly, Erik Miehling Published: 2024-09-23Area: Safety EvaluationCitations: 14 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2024-09-23 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (95%) | 14 |
| Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction Jinchuan Zhang, Songlin Hu, Yan Zhou, Yaxin Liu Published: 2024-09-25Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-09-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 22 |
| PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System Amanda J. Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2024-10-01Area: Safety EvaluationCitations: 15 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | 2024-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E6 / R4 (96%) | 15 |
| Automated Red Teaming with GOAT: the Generative Offensive Agent Tester Aaron Grattafiori, Cristian Canton Ferrer, Erik Brinkman, Hailey Nguyen Published: 2024-10-02Area: Safety EvaluationCitations: 32 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-10-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (98%) | 32 |
| Bridging Today and the Future of Humanity: AI Safety in 2024 and Beyond Shanshan Han Published: 2024-10-09Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, red-teaming, survey, surveys-reviews | 2024-10-09 | Surveys & Reviews | adversarial-robustness, ai-safety, red-teaming, survey, surveys-reviews | E6 / R3 (92%) | 1 |
| Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs Elgizouli Mohamed, Muhammad Abdul-Mageed, Muhammed Saeed, Mukhtar Mohamed Published: 2024-10-31Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-10-31 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E6 / R3 (95%) | - |
| Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning Alex Beutel, Johannes Heidecke, Kai Xiao, Lilian Weng Published: 2024-12-24Area: Safety EvaluationCitations: 22 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 22 |
| Lessons From Red Teaming 100 Generative AI Products Amanda Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2025-01-13Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-01-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 20 |
| OpenAI's Approach to External Red Teaming for AI Models and Systems Lama Ahmad, Michael Lampe, Pamela Mishkin, Sandhini Agarwal Published: 2025-01-24Area: Safety EvaluationCitations: 33 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E6 / R4 (97%) | 33 |