Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 94 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| On Adaptive Attacks to Adversarial Example Defenses Aleksander Madry, Florian Tramer, Nicholas Carlini, Wieland Brendel Published: 2020-02-19Area: Adversarial RobustnessCitations: 921 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2020-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E9 / R3 (98%) | 921 |
| Aligning AI With Shared Human Values Andrew Critch, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-08-05Area: Safety EvaluationCitations: 810 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2020-08-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R5 (94%) | 810 |
| Measuring Massive Multitask Language Understanding Andy Zou, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-09-07Area: Safety EvaluationCitations: 7081 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 7081 |
| The Radicalization Risks of GPT-3 and Advanced Neural Language Models Alex Newhouse, Kris McGuffie Published: 2020-09-15Area: Safety EvaluationCitations: 164 Tags: ai-safety, empirical, safety-evaluation | 2020-09-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | 164 |
| RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models Maarten Sap, Noah A. Smith, Samuel Gehman, Suchin Gururangan Published: 2020-09-24Area: Safety EvaluationCitations: 1530 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 1530 |
| RobustBench: a standardized adversarial robustness benchmark Edoardo Debenedetti, Francesco Croce, Maksym Andriushchenko, Matthias Hein Published: 2020-10-19Area: Adversarial RobustnessCitations: 836 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2020-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | 836 |
| WILDS: A Benchmark of in-the-Wild Distribution Shifts Akshay Balsubramani, Anshul Kundaje, Berton A. Earnshaw, Chelsea Finn Published: 2020-12-14Area: Safety EvaluationCitations: 1690 Tags: ai-safety, benchmark, safety-evaluation | 2020-12-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (99%) | 1690 |
| Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling A. Stevie Bergman, Dirk Hovy, Emily Dinan, Gavin Abercrombie Published: 2021-07-07Area: Safety EvaluationCitations: 115 Tags: ai-safety, safety-evaluation, tool | 2021-07-07 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (93%) | 115 |
| Neuron-level Interpretation of Deep NLP Models: A Survey Fahim Dalvi, Hassan Sajjad, Nadir Durrani Published: 2021-08-30Area: Representation AnalysisCitations: 97 Tags: ai-safety, representation-analysis, safety-evaluation, survey | 2021-08-30 | Representation Analysis | ai-safety, representation-analysis, safety-evaluation, survey | E5 / R3 (94%) | 97 |
| TruthfulQA: Measuring How Models Mimic Human Falsehoods Jacob Hilton, Owain Evans, Stephanie Lin Published: 2021-09-08Area: Safety EvaluationCitations: 2869 Tags: ai-safety, benchmark, safety-evaluation | 2021-09-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 2869 |
| BBQ: A Hand-Built Bias Benchmark for Question Answering Alicia Parrish, Angelica Chen, Jana Thompson, Jason Phang Published: 2021-10-15Area: Safety EvaluationCitations: 643 Tags: ai-safety, benchmark, safety-evaluation | 2021-10-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 643 |
| Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models Ahmed Hassan Awadallah, Bo Li, Boxin Wang, Chejian Xu Published: 2021-11-04Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2021-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E8 / R3 (95%) | 284 |
| Towards Adversarial Evaluations for Inexact Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2022-01-17Area: Model EditingCitations: 79 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2022-01-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (93%) | 79 |
| Red Teaming Language Models with Language Models Amelia Glaese, Ethan Perez, Francis Song, Geoffrey Irving Published: 2022-02-07Area: Safety EvaluationCitations: 919 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2022-02-07 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 919 |
| Teaching Models to Express Their Uncertainty in Words Jacob Hilton, Owain Evans, Stephanie Lin Published: 2022-05-28Area: Safety EvaluationCitations: 590 Tags: ai-safety, empirical, safety-evaluation | 2022-05-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 590 |
| Language Models (Mostly) Know What They Know Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-07-11Area: Safety EvaluationCitations: 1254 Tags: ai-safety, empirical, safety-evaluation | 2022-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 1254 |
| Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-08-23Area: Safety EvaluationCitations: 675 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2022-08-23 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 675 |
| Adversarial Policies Beat Superhuman Go AIs Adam Gleave, Joseph Miller, Kellin Pelrine, Michael D. Dennis Published: 2022-11-01Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 33 |
| Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 Small Alexandre Variengien, Arthur Conmy, Buck Shlegeris, Jacob Steinhardt Published: 2022-11-01Area: Mechanistic Interp.Citations: 834 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2022-11-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 834 |
| Do Users Write More Insecure Code with AI Assistants? Dan Boneh, Deepak Kumar, Megha Srivastava, Neil Perry Published: 2022-11-07Area: Safety EvaluationCitations: 288 Tags: ai-safety, empirical, safety-evaluation | 2022-11-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 288 |
| Holistic Evaluation of Language Models Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan Published: 2022-11-16Area: Safety EvaluationCitations: 10 Tags: ai-safety, benchmark, safety-evaluation | 2022-11-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 10 |
| Diagnostics for Deep Neural Networks with Automated Copy/Paste Attacks Dylan Hadfield-Menell, Kaivalya Hariharan, Stephen Casper Published: 2022-11-18Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-18 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 11 |
| On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning Diyi Yang, Hongxin Zhang, Michael Bernstein, Omar Shaikh Published: 2022-12-15Area: Safety EvaluationCitations: 249 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2022-12-15 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 249 |
| Discovering Language Model Behaviors with Model-Written Evaluations Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-12-19Area: Safety EvaluationCitations: 640 Tags: ai-safety, benchmark, safety-evaluation | 2022-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 640 |
| A Watermark for Large Language Models Ian Miers, John Kirchenbauer, Jonas Geiping, Jonathan Katz Published: 2023-01-24Area: Safety EvaluationCitations: 777 Tags: ai-safety, empirical, safety-evaluation | 2023-01-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 777 |
| Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity Chunyang Chen, Terry Yue Zhuo, Yujin Huang, Zhenchang Xing Published: 2023-01-30Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R5 (96%) | 137 |
| Red Teaming Deep Neural Networks with Feature Synthesis Tools Dylan Hadfield-Menell, Jiawei Li, Kaivalya Hariharan, Kevin Zhang Published: 2023-02-08Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | 2023-02-08 | Safety Evaluation | ai-safety, benchmark, interpretability, red-teaming, safety-evaluation | E6 / R3 (96%) | 21 |
| Auditing Large Language Models: A Three-Layered Approach Hannah Rose Kirk, Jakob Mokander, Jonas Schuett, Luciano Floridi Published: 2023-02-16Area: Safety EvaluationCitations: 277 Tags: ai-safety, position, safety-evaluation | 2023-02-16 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (95%) | 277 |
| Automatically Auditing Large Language Models via Discrete Optimization Aditi Raghunathan, Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2023-03-08Area: Safety EvaluationCitations: 220 Tags: ai-safety, empirical, safety-evaluation | 2023-03-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 220 |
| MACHIAVELLI: A Benchmark for Understanding and Mitigating Power-Seeking and Deception in AI Alexander Pan, Andy Zou, Dan Hendrycks, Hanlin Zhang Published: 2023-04-06Area: Safety EvaluationCitations: 176 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 176 |