Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 335 papers (page 1 of 12)路 134 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Measuring Robustness to Natural Distribution Shifts in Image Classification Achal Dave, Benjamin Recht, Ludwig Schmidt, Nicholas Carlini Published: 2020-07-01Area: Adversarial RobustnessCitations: 644 Tags: adversarial-robustness, ai-safety, benchmark | 2020-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (95%) | 644 |
| Aligning AI With Shared Human Values Andrew Critch, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-08-05Area: Safety EvaluationCitations: 810 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2020-08-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R5 (94%) | 810 |
| Measuring Massive Multitask Language Understanding Andy Zou, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-09-07Area: Safety EvaluationCitations: 7081 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 7081 |
| RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models Maarten Sap, Noah A. Smith, Samuel Gehman, Suchin Gururangan Published: 2020-09-24Area: Safety EvaluationCitations: 1530 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 1530 |
| RobustBench: a standardized adversarial robustness benchmark Edoardo Debenedetti, Francesco Croce, Maksym Andriushchenko, Matthias Hein Published: 2020-10-19Area: Adversarial RobustnessCitations: 836 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2020-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | 836 |
| WILDS: A Benchmark of in-the-Wild Distribution Shifts Akshay Balsubramani, Anshul Kundaje, Berton A. Earnshaw, Chelsea Finn Published: 2020-12-14Area: Safety EvaluationCitations: 1690 Tags: ai-safety, benchmark, safety-evaluation | 2020-12-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (99%) | 1690 |
| TruthfulQA: Measuring How Models Mimic Human Falsehoods Jacob Hilton, Owain Evans, Stephanie Lin Published: 2021-09-08Area: Safety EvaluationCitations: 2869 Tags: ai-safety, benchmark, safety-evaluation | 2021-09-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 2869 |
| BBQ: A Hand-Built Bias Benchmark for Question Answering Alicia Parrish, Angelica Chen, Jana Thompson, Jason Phang Published: 2021-10-15Area: Safety EvaluationCitations: 643 Tags: ai-safety, benchmark, safety-evaluation | 2021-10-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 643 |
| What Would Jiminy Cricket Do? Towards Agents That Behave Morally Andy Zou, Bo Li, Christine Zhu, Dan Hendrycks Published: 2021-10-25Area: Agent SafetyCitations: 72 Tags: agent-safety, ai-safety, benchmark | 2021-10-25 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (93%) | 72 |
| Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models Ahmed Hassan Awadallah, Bo Li, Boxin Wang, Chejian Xu Published: 2021-11-04Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2021-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E8 / R3 (95%) | 284 |
| BackdoorBench: A Comprehensive Benchmark of Backdoor Learning Baoyuan Wu, Chao Shen, Danni Yuan, Hongrui Chen Published: 2022-06-25Area: Adversarial RobustnessCitations: 195 Tags: adversarial-robustness, ai-safety, benchmark | 2022-06-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (99%) | 195 |
| Is Reinforcement Learning (Not) for Natural Language Processing?: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization Christian Bauckhage, Hannaneh Hajishirzi, Jack Hessel, Kiant茅 Brantley Published: 2022-10-03Area: Alignment TrainingCitations: 283 Tags: ai-safety, alignment-training, benchmark | 2022-10-03 | Alignment Training | ai-safety, alignment-training, benchmark | E5 / R3 (96%) | 283 |
| Holistic Evaluation of Language Models Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan Published: 2022-11-16Area: Safety EvaluationCitations: 10 Tags: ai-safety, benchmark, safety-evaluation | 2022-11-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 10 |
| Discovering Language Model Behaviors with Model-Written Evaluations Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-12-19Area: Safety EvaluationCitations: 640 Tags: ai-safety, benchmark, safety-evaluation | 2022-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 640 |
| Red Teaming Deep Neural Networks with Feature Synthesis Tools Dylan Hadfield-Menell, Jiawei Li, Kaivalya Hariharan, Kevin Zhang Published: 2023-02-08Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | 2023-02-08 | Safety Evaluation | ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | E6 / R3 (96%) | 21 |
| MACHIAVELLI: A Benchmark for Understanding and Mitigating Power-Seeking and Deception in AI Alexander Pan, Andy Zou, Dan Hendrycks, Hanlin Zhang Published: 2023-04-06Area: Safety EvaluationCitations: 176 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 176 |
| Safety Assessment of Chinese Large Language Models Hao Sun, Jiale Cheng, Jiawen Deng, Minlie Huang Published: 2023-04-20Area: Safety EvaluationCitations: 103 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 103 |
| Adversarial Nibbler: A Data-Centric Challenge for Improving the Safety of Text-to-Image Models Addison Howard, Alicia Parrish, Charvi Rastogi, D. Sculley Published: 2023-05-22Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 12 |
| MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions Christopher D. Manning, Christopher Potts, Danqi Chen, Zexuan Zhong Published: 2023-05-24Area: Model EditingCitations: 288 Tags: ai-safety, benchmark, model-editing | 2023-05-24 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 288 |
| PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts Hao Chen, Jiaheng Zhou, Jindong Wang, Kaijie Zhu Published: 2023-06-07Area: Adversarial RobustnessCitations: 235 Tags: adversarial-robustness, ai-safety, benchmark | 2023-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 235 |
| Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena Dacheng Li, Eric P. Xing, Hao Zhang, Ion Stoica Published: 2023-06-09Area: Safety EvaluationCitations: 7108 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 7108 |
| Inverse Scaling: When Bigger Isn't Better Aaron Mueller, Alexander Lyzhov, Alicia Parrish, Ameya Prabhu Published: 2023-06-15Area: Safety EvaluationCitations: 189 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 189 |
| DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Bo Li, Boxin Wang, Chejian Xu, Chenhui Zhang Published: 2023-06-20Area: Safety EvaluationCitations: 575 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-06-20 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 575 |
| CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility Chao Peng, Fei Huang, Guohai Xu, Haotian Xu Published: 2023-07-19Area: Safety EvaluationCitations: 99 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2023-07-19 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 99 |
| Evaluating the Ripple Effects of Knowledge Editing in Language Models Amir Globerson, Eden Biran, Mor Geva, Ori Yoran Published: 2023-07-24Area: Model EditingCitations: 241 Tags: ai-safety, benchmark, model-editing | 2023-07-24 | Model Editing | ai-safety, benchmark, model-editing | E4 / R3 (94%) | 241 |
| XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models Bertie Vidgen, Dirk Hovy, Federico Bianchi, Giuseppe Attanasio Published: 2023-08-02Area: Safety EvaluationCitations: 283 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 283 |
| Benchmarks for Detecting Measurement Tampering Buck Shlegeris, Fabien Roger, Max Nadeau, Nate Thomas Published: 2023-08-29Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 4 |
| FIND: A Function Description Benchmark for Evaluating Interpretability Methods Antonio Torralba, David Bau, Jacob Andreas, Joanna Materzynska Published: 2023-09-07Area: Mechanistic Interp.Citations: 32 Tags: ai-safety, benchmark, interpretability, mechanistic-interp | 2023-09-07 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp | E4 / R3 (94%) | 32 |
| SafetyBench: Evaluating the Safety of Large Language Models Chong Long, Jie Tang, Leqi Lei, Lindong Wu Published: 2023-09-13Area: Safety EvaluationCitations: 182 Tags: ai-safety, benchmark, safety-evaluation | 2023-09-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 182 |
| Can Language Models be Instructed to Protect Personal Information? Alan Ritter, Ethan Mendes, Sauvik Das, Wei Xu Published: 2023-10-03Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 48 |