Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models Bowen Dong, Dahua Lin, Jing Shao, Lijun Li Published: 2024-02-07Area: Safety EvaluationCitations: 193 Tags: ai-safety, benchmark, safety-evaluation | 2024-02-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 193 |
| Secret Collusion Among Generative AI Agents Christian Schroeder de Witt, Lewis Hammond, Martin Strohmeier, Mikhail Baranchuk Published: 2024-02-12Area: Agent SafetyCitations: 59 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2024-02-12 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 59 |
| Rethinking Machine Unlearning for Large Language Models Chris Yuhao Liu, Hang Li, Jinghan Jia, Kush R. Varshney Published: 2024-02-13Area: Model EditingCitations: 227 Tags: ai-safety, alignment-training, model-editing, safety-evaluation, survey | 2024-02-13 | Model Editing | ai-safety, alignment-training, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 227 |
| Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation Alicia Parrish, Charvi Rastogi, Erin van Liemt, Hannah Rose Kirk Published: 2024-02-14Area: Safety EvaluationCitations: 19 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-14 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 19 |
| Attacking Large Language Models with Projected Gradient Descent Johannes Gasteiger, M. H. I. Abdalla, Simon Geisler, Stephan Günnemann Published: 2024-02-14Area: Adversarial RobustnessCitations: 105 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 105 |
| Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey Chao Yang, Jing Shao, Yu Qiao, Zhanhui Zhou Published: 2024-02-14Area: Surveys & ReviewsCitations: 140 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-02-14 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (98%) | 140 |
| A StrongREJECT for Empty Jailbreaks Alexandra Souly, Dillon Bowen, Elvis Hsieh, Justin Svegliato Published: 2024-02-15Area: Safety EvaluationCitations: 217 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-15 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 217 |
| CausalGym: Benchmarking Causal Interpretability Methods on Linguistic Tasks Aryaman Arora, Christopher Potts, Dan Jurafsky Published: 2024-02-19Area: Safety EvaluationCitations: 36 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-19 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E5 / R3 (95%) | 36 |
| UnlearnCanvas: A Stylized Image Dataset to Benchmark Machine Unlearning for Diffusion Models Jiancheng Liu, Jinghan Jia, Sijia Liu, Xiaoming Liu Published: 2024-02-19Area: Model EditingCitations: 22 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-02-19 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (96%) | 22 |
| Eight Methods to Evaluate Robust Unlearning in LLMs Aengus Lynch, Aidan Ewart, Dylan Hadfield-Menell, Phillip Guo Published: 2024-02-26Area: Safety EvaluationCitations: 124 Tags: ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 124 |
| Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts Andrei Lupu, Aram H. Markosyan, Eric Hambro, Jack Parker-Holder Published: 2024-02-26Area: Safety EvaluationCitations: 160 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | 160 |
| ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors Di Zhang, Hao Sun, Hongning Wang, Jingyuan Ma Published: 2024-02-26Area: Safety EvaluationCitations: 49 Tags: ai-safety, safety-evaluation, tool | 2024-02-26 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 49 |
| RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations Atticus Geiger, Christopher Potts, Jing Huang, Mor Geva Published: 2024-02-27Area: Safety EvaluationCitations: 61 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-27 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E4 / R3 (98%) | 61 |
| Exploring Advanced Methodologies in Security Evaluation for LLMs Jiawei Zhang, Jun Huang, Qi Wang, Weihong Han Published: 2024-02-28Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, survey | 2024-02-28 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R3 (93%) | - |
| Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling Anirudh Goyal, Kenji Kawaguchi, Michael Shieh, Tianle Cai Published: 2024-03-02Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-03-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R5 (95%) | 31 |
| The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning Adam A. Hunt, Adam Khoja, Alexander Pan, Alexandr Wang Published: 2024-03-05Area: Safety EvaluationCitations: 341 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 341 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| Safety Cases: How to Justify the Safety of Advanced AI Systems David Krueger, Joshua Clymer, Nicholas Gabrieli, Thomas Larsen Published: 2024-03-15Area: Safety EvaluationCitations: 54 Tags: ai-safety, position, safety-evaluation | 2024-03-15 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (93%) | 54 |
| Evaluating Frontier Models for Dangerous Capabilities Albert Webson, Alexandre Kaskasoli, Allan Dafoe, Anca Dragan Published: 2024-03-20Area: Safety EvaluationCitations: 107 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 107 |
| RewardBench: Evaluating Reward Models for Language Modeling Bill Yuchen Lin, Hannaneh Hajishirzi, Jacob Morrison, Khyathi Chandu Published: 2024-03-20Area: Safety EvaluationCitations: 366 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 366 |
| On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial Francesco Salvi, Manoel Horta Ribeiro, Riccardo Gallotti, Robert West Published: 2024-03-21Area: Safety EvaluationCitations: 95 Tags: ai-safety, empirical, safety-evaluation | 2024-03-21 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 95 |
| JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Alexander Robey, Edgar Dobriban, Edoardo Debenedetti, Eric Wong Published: 2024-03-28Area: Adversarial RobustnessCitations: 330 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-03-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 330 |
| Digital Forgetting in Large Language Models: A Survey of Unlearning Methods Alberto Blanco-Justicia, Benet Manzanares, David Sánchez, Guillem Collell Published: 2024-04-02Area: Model EditingCitations: 45 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-04-02 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (96%) | 45 |
| ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-04-06Area: Safety EvaluationCitations: 83 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-04-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E4 / R3 (96%) | 83 |
| Rethinking How to Evaluate Language Model Jailbreak Antonio Bianchi, Arjun Arunasalam, Hongyu Cai, Leo Y. Lin Published: 2024-04-09Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-04-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (94%) | 12 |
| JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models Minfeng Zhu, Sijia Wang, Wei Chen, Wei Zhang Published: 2024-04-12Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-04-12 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 8 |
| LLM Evaluators Recognize and Favor Their Own Generations Arjun Panickssery, Samuel R. Bowman, Shi Feng Published: 2024-04-15Area: Safety EvaluationCitations: 381 Tags: ai-safety, empirical, safety-evaluation | 2024-04-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 381 |
| CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song, David Molnar Published: 2024-04-19Area: Safety EvaluationCitations: 71 Tags: ai-safety, benchmark, safety-evaluation | 2024-04-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 71 |
| Holistic Safety and Responsibility Evaluations of Advanced AI Models Allan Dafoe, Christina Butterfield, Dawn Bloxwich, Iason Gabriel Published: 2024-04-22Area: Safety EvaluationCitations: 17 Tags: ai-safety, safety-evaluation, survey | 2024-04-22 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 17 |
| Mechanistic Interpretability for AI Safety — A Review Efstratios Gavves, Leonard Bereska Published: 2024-04-22Area: Surveys & ReviewsCitations: 335 Tags: ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | 2024-04-22 | Surveys & Reviews | ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | E5 / R3 (93%) | 335 |