Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Analyzing Probabilistic Methods for Evaluating Agent Capabilities Arjun Panickssery, Axel H酶jmark, Govind Pimpale, J茅r茅my Scheurer Published: 2024-09-24Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2024-09-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (93%) | 4 |
| Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction Jinchuan Zhang, Songlin Hu, Yan Zhou, Yaxin Liu Published: 2024-09-25Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-09-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 22 |
| HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection Chaowei Xiao, Xuefeng Du, Yixuan Li Published: 2024-09-26Area: Safety EvaluationCitations: 76 Tags: ai-safety, empirical, safety-evaluation | 2024-09-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | 76 |
| A Survey on the Honesty of Large Language Models Cheng Yang, Chufan Shi, Deng Cai, Jie Zhou Published: 2024-09-27Area: Surveys & ReviewsCitations: 18 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2024-09-27 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R4 (94%) | 18 |
| PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System Amanda J. Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2024-10-01Area: Safety EvaluationCitations: 15 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | 2024-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E6 / R4 (96%) | 15 |
| Automated Red Teaming with GOAT: the Generative Offensive Agent Tester Aaron Grattafiori, Cristian Canton Ferrer, Erik Brinkman, Hailey Nguyen Published: 2024-10-02Area: Safety EvaluationCitations: 32 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-10-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (98%) | 32 |
| Position: LLM Unlearning Benchmarks are Weak Measures of Progress Neil Kale, Pratiksha Thaker, Shengyuan Hu, Virginia Smith Published: 2024-10-03Area: Safety EvaluationCitations: 45 Tags: ai-safety, position, safety-evaluation | 2024-10-03 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (97%) | 45 |
| A Probabilistic Perspective on Unlearning and Alignment for Large Language Models Leo Schwinn, Stephan G眉nnemann, Yan Scholten Published: 2024-10-04Area: Model EditingCitations: 18 Tags: ai-safety, alignment-training, empirical, model-editing, safety-evaluation | 2024-10-04 | Model Editing | ai-safety, alignment-training, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 18 |
| Attention Shift: Steering AI Away from Unsafe Content Manyana Tiwari, Shivank Garg Published: 2024-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Towards Measuring Goal-Directedness in AI Systems Dylan Xu, Juan-Pablo Rivera Published: 2024-10-07Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-10-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (91%) | 5 |
| Holistic Unlearning Benchmark: A Multi-Faceted Evaluation for Text-to-Image Diffusion Model Unlearning Dongwoo Kim, Minjong Lee, Saemi Moon, Sangdon Park Published: 2024-10-08Area: Safety EvaluationCitations: 9 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 9 |
| PII-Scope: A Benchmark for Training Data PII Leakage Assessment in LLMs Ahmed Frikha, Krishna Kanth Nakka, Ricardo Mendes, Xuebing Zhou Published: 2024-10-09Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (98%) | 4 |
| Recent advancements in LLM Red-Teaming: Techniques, Defenses, and Ethical Considerations Nilay Pochhi, Tarun Raheja Published: 2024-10-09Area: Safety EvaluationCitations: 12 Tags: ai-safety, safety-evaluation, survey | 2024-10-09 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R4 (94%) | 12 |
| SAGE: Scalable Ground Truth Evaluations for Large Sparse Autoencoders Anisoara Calinescu, Christian Schroeder de Witt, Constantin Venhoff, Philip Torr Published: 2024-10-09Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (96%) | 1 |
| A Closer Look at Machine Unlearning for Large Language Models Chao Du, Kejiang Chen, Min Lin, Tianyu Pang Published: 2024-10-10Area: Model EditingCitations: 35 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-10-10 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 35 |
| Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities Andrey Anurin, Esben Kran, Jason Schreiber, Jonathan Ng Published: 2024-10-10Area: Safety EvaluationCitations: 7 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger Published: 2024-10-11Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-10-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 49 |
| JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework Dawei Yin, Fan Liu, Hao Liu, Lixin Su Published: 2024-10-11Area: Safety EvaluationCitations: 36 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-10-11 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 36 |
| To Err is AI: A Case Study Informing LLM Flaw Reporting Practices Allyson Ettinger, Avijit Ghosh, Christopher Fiorelli, Kavel Rao Published: 2024-10-15Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-10-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (97%) | 5 |
| Estimating the Probabilities of Rare Outputs in Language Models Gabriel Wu, Jacob Hilton Published: 2024-10-17Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2024-10-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R5 (96%) | 6 |
| Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis Aishvariya Priya, Amit Giloni, Hisashi Kojima, Inderjeet Singh Published: 2024-10-21Area: Safety EvaluationCitations: 8 Tags: ai-safety, safety-evaluation, survey | 2024-10-21 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (94%) | 8 |
| LLMScan: Causal Scan for LLM Misbehavior Detection Jun Sun, Kai Kiat Goh, Mengdi Zhang, Peixin Zhang Published: 2024-10-22Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 6 |
| Towards Reliable Evaluation of Behavior Steering Interventions in LLMs David Krueger, Ekdeep Singh Lubana, Itamar Pres, Laura Ruis Published: 2024-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 23 |
| ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models Bing Wang, Bingyi Jing, Guanhua Chen, Haifeng Bai Published: 2024-10-24Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (98%) | 6 |
| SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models Aishan Liu, Dacheng Tao, Jinyang Guo, Lei Huang Published: 2024-10-24Area: Multimodal SafetyCitations: 44 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2024-10-24 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 44 |
| An Auditing Test To Detect Behavioral Shift in Language Models Leo Richter, Matt J. Kusner, Pasquale Minervini, Xuanli He Published: 2024-10-25Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-10-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 2 |
| Sabotage Evaluations for Frontier Models Buck Shlegeris, Cem Anil, David Duvenaud, Deep Ganguli Published: 2024-10-28Area: Safety EvaluationCitations: 29 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 29 |
| Safety Cases for Frontier AI Gaurav Sett, Jonas Schuett, Leonie Koessler, Marie Davidsen Buhl Published: 2024-10-28Area: Safety EvaluationCitations: 23 Tags: ai-safety, position, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, position, safety-evaluation | E4 / R3 (96%) | 23 |
| CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs Chenhui Hu, Zhihao Liu Published: 2024-10-29Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types Shikun Zhang, Wei Ye, Yutao Mou Published: 2024-10-29Area: Safety EvaluationCitations: 48 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 48 |