Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Automated Progressive Red Teaming Bojian Jiang, Deyi Xiong, Qing Yang, Tianhao Shen Published: 2024-07-04Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E8 / R5 (96%) | 11 |
| Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs Alexander Meinke, Bilal Chughtai, Jan Betley, J茅r茅my Scheurer Published: 2024-07-05Area: Safety EvaluationCitations: 46 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 46 |
| MUSE: Machine Unlearning Six-Way Evaluation for Language Models Ari Holtzman, Chiyuan Zhang, Daogao Liu, Jaechan Lee Published: 2024-07-08Area: Model EditingCitations: 174 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-07-08 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (97%) | 174 |
| Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture Jiayang Song, Lei Ma, Yuheng Huang, Zhehua Zhou Published: 2024-07-10Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 19 |
| AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies Andy Zhou, Bo Li, Dawn Song, Jeffrey Ziwei Tan Published: 2024-07-11Area: Safety EvaluationCitations: 55 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 55 |
| On the (In)Security of LLM App Stores Haoyu Wang, Xinyi Hou, Yanjie Zhao Published: 2024-07-11Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 21 |
| ASTPrompter: Weakly Supervised Automated Language Model Red-Teaming to Identify Likely Toxic Prompts Amelia F. Hardy, Bernard Lange, Houjun Liu, Mykel J. Kochenderfer Published: 2024-07-12Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 2 |
| Evaluating AI Evaluation: Perils and Prospects John Burden Published: 2024-07-12Area: Safety EvaluationCitations: 16 Tags: ai-safety, position, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 16 |
| DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation Ling Shi, Mingke Yang, Yi Liu, Yuqi Chen Published: 2024-07-14Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-14 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 9 |
| The Better Angels of Machine Personality: How Personality Relates to LLM Safety Chen Qian, Dongrui Liu, Jie Zhang, Jing Shao Published: 2024-07-17Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (93%) | 21 |
| InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques Adri脿 Garriga-Alonso, Iv谩n Arcuschin, Rohan Gupta, Thomas Kwa Published: 2024-07-19Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-07-19 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (98%) | 7 |
| Operationalizing a Threat Model for Red-Teaming Large Language Models Anu Pradhan, Apurv Verma, David Rabinowitz, John Doucette Published: 2024-07-20Area: Safety EvaluationCitations: 42 Tags: ai-safety, safety-evaluation, survey | 2024-07-20 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (97%) | 42 |
| Adversarial Circuit Evaluation Adri脿 Garriga-Alonso, Niels uit de Bos Published: 2024-07-21Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-07-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent Feng Xiao, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-07-23Area: Safety EvaluationCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 30 |
| The Art of Refusal: A Survey of Abstention in Large Language Models Bill Howe, Bingbing Wen, Chenjun Xu, Jihan Yao Published: 2024-07-25Area: Surveys & ReviewsCitations: 55 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-07-25 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 55 |
| Machine Unlearning in Generative AI: A Survey Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-07-30Area: Model EditingCitations: 47 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-07-30 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R3 (95%) | 47 |
| Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress? Adam Khoja, Alexander Pan, Alice Gatti, Dan Hendrycks Published: 2024-07-31Area: Safety EvaluationCitations: 53 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-31 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (94%) | 53 |
| On the Limitations and Prospects of Machine Unlearning for Generative AI Heng Chang, Jiangnan Ye, Lianzhe Wang, Shiji Zhou Published: 2024-08-01Area: Model EditingCitations: 14 Tags: ai-safety, model-editing, position, safety-evaluation | 2024-08-01 | Model Editing | ai-safety, model-editing, position, safety-evaluation | E5 / R4 (96%) | 14 |
| CyberSecEval 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models Cyrus Nikolaidis, Daniel Song, David Molnar, James Crnkovich Published: 2024-08-02Area: Safety EvaluationCitations: 39 Tags: ai-safety, benchmark, safety-evaluation | 2024-08-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 39 |
| Reasons to Doubt the Impact of AI Risk Evaluations Gabriel Mukobi Published: 2024-08-05Area: Safety EvaluationCitations: 6 Tags: ai-safety, position, safety-evaluation | 2024-08-05 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (95%) | 6 |
| Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks Dongxia Wang, Jiaying Chen, Kexin Chen, Wenhai Wang Published: 2024-08-18Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |
| Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh Published: 2024-08-20Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-08-20 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R4 (95%) | 6 |
| PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action Diyi Yang, Tianshi Li, Weiyan Shi, Yanchen Liu Published: 2024-08-29Area: Safety EvaluationCitations: 94 Tags: ai-safety, benchmark, safety-evaluation | 2024-08-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 94 |
| Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models Bang An, Furong Huang, Michael-Andrei Panaitescu-Liess, Ruiyi Zhang Published: 2024-09-01Area: Safety EvaluationCitations: 30 Tags: ai-safety, benchmark, safety-evaluation | 2024-09-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 30 |
| Conversational Complexity for Assessing Risk in Large Language Models John Burden, Jose Hernandez-Orallo, Manuel Cebrian Published: 2024-09-02Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-09-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 5 |
| Exploring Straightforward Conversational Red-Teaming Ateret Anaby-Tavor, Eitan Farchi, George Kour, Marcel Zalmanovici Published: 2024-09-07Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2024-09-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| TracrBench: Generating Interpretability Testbeds with Large Language Models Hannes Thurnherr, J茅r茅my Scheurer Published: 2024-09-07Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-09-07 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (97%) | 4 |
| Unlearning or Concealment? A Critical Analysis and Evaluation Metrics for Unlearning in Diffusion Models Aakash Sen Sharma, Ankur A. Mali, Murari Mandal, Niladri Sarkar Published: 2024-09-09Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-09-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 9 |
| Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols Alessandro Abate, Buck Shlegeris, Charlie Griffin, Louis Thomson Published: 2024-09-12Area: Scalable OversightCitations: 17 Tags: ai-safety, safety-evaluation, scalable-oversight, theoretical | 2024-09-12 | Scalable Oversight | ai-safety, safety-evaluation, scalable-oversight, theoretical | E5 / R3 (94%) | 17 |
| Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI Ambrish Rawat, Beat Buesser, Elizabeth M. Daly, Erik Miehling Published: 2024-09-23Area: Safety EvaluationCitations: 14 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2024-09-23 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (95%) | 14 |