Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 85 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Natural Adversarial Examples Dan Hendrycks, Dawn Song, Jacob Steinhardt, Kevin Zhao Published: 2019-07-16Area: Adversarial RobustnessCitations: 1794 Tags: adversarial-robustness, ai-safety, dataset | 2019-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (95%) | 1794 |
| On Adaptive Attacks to Adversarial Example Defenses Aleksander Madry, Florian Tramer, Nicholas Carlini, Wieland Brendel Published: 2020-02-19Area: Adversarial RobustnessCitations: 921 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2020-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E9 / R3 (98%) | 921 |
| Weight Poisoning Attacks on Pretrained Models Graham Neubig, Keita Kurita, Paul Michel Published: 2020-04-14Area: Adversarial RobustnessCitations: 551 Tags: adversarial-robustness, ai-safety, empirical | 2020-04-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 551 |
| Measuring Robustness to Natural Distribution Shifts in Image Classification Achal Dave, Benjamin Recht, Ludwig Schmidt, Nicholas Carlini Published: 2020-07-01Area: Adversarial RobustnessCitations: 644 Tags: adversarial-robustness, ai-safety, benchmark | 2020-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (95%) | 644 |
| You Autocomplete Me: Poisoning Vulnerabilities in Neural Code Completion Congzheng Song, Eran Tromer, Roei Schuster, Vitaly Shmatikov Published: 2020-07-05Area: Adversarial RobustnessCitations: 190 Tags: adversarial-robustness, ai-safety, empirical | 2020-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 190 |
| RobustBench: a standardized adversarial robustness benchmark Edoardo Debenedetti, Francesco Croce, Maksym Andriushchenko, Matthias Hein Published: 2020-10-19Area: Adversarial RobustnessCitations: 836 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2020-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | 836 |
| Concealed Data Poisoning Attacks on NLP Models Eric Wallace, Sameer Singh, Shi Feng, Tony Z. Zhao Published: 2020-10-23Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2020-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (94%) | 20 |
| Extracting Training Data from Large Language Models Adam Roberts, Alina Oprea, Ariel Herbert-Voss, Colin Raffel Published: 2020-12-14Area: Adversarial RobustnessCitations: 2624 Tags: adversarial-robustness, ai-safety, empirical | 2020-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2624 |
| Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models Bin He, Lei Li, Wenkai Yang, Xuancheng Ren Published: 2021-03-29Area: Adversarial RobustnessCitations: 171 Tags: adversarial-robustness, ai-safety, empirical | 2021-03-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 171 |
| Gradient-based Adversarial Attacks against Text Transformers Alexandre Sablayrolles, Chuan Guo, Douwe Kiela, Herv茅 J茅gou Published: 2021-04-15Area: Adversarial RobustnessCitations: 302 Tags: adversarial-robustness, ai-safety, empirical | 2021-04-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 302 |
| Poisoning and Backdooring Contrastive Learning Andreas Terzis, Nicholas Carlini Published: 2021-06-17Area: Adversarial RobustnessCitations: 202 Tags: adversarial-robustness, ai-safety, empirical | 2021-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 202 |
| Robust Feature-Level Adversaries are Interpretability Tools Dylan Hadfield-Menell, Gabriel Kreiman, Max Nadeau, Stephen Casper Published: 2021-10-07Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2021-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E5 / R3 (94%) | 34 |
| Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models Ahmed Hassan Awadallah, Bo Li, Boxin Wang, Chejian Xu Published: 2021-11-04Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2021-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E8 / R3 (95%) | 284 |
| Towards Adversarial Evaluations for Inexact Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2022-01-17Area: Model EditingCitations: 79 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2022-01-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (93%) | 79 |
| Adversarial vulnerability of powerful near out-of-distribution detection Stanislav Fort Published: 2022-01-18Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2022-01-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 18 |
| Red Teaming Language Models with Language Models Amelia Glaese, Ethan Perez, Francis Song, Geoffrey Irving Published: 2022-02-07Area: Safety EvaluationCitations: 919 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2022-02-07 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 919 |
| Adversarial Training for High-Stakes Reliability Adam Scherlis, Ben Weinstein-Raun, Buck Shlegeris, Daniel de Haas Published: 2022-05-03Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2022-05-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 73 |
| BackdoorBench: A Comprehensive Benchmark of Backdoor Learning Baoyuan Wu, Chao Shen, Danni Yuan, Hongrui Chen Published: 2022-06-25Area: Adversarial RobustnessCitations: 195 Tags: adversarial-robustness, ai-safety, benchmark | 2022-06-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (99%) | 195 |
| Adversarial Attacks on Image Generation With Made-Up Words Rapha毛l Milli猫re Published: 2022-08-04Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2022-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 43 |
| Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples Aditya Bahl, Daniel del Castillo Iglesias, Hezekiah J. Branch, Jeremy McHugh Published: 2022-09-05Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, empirical | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 74 |
| Red Teaming with Mind Reading: White-Box Adversarial Policies Against RL Agents Dylan Hadfield-Menell, Gabriel Kreiman, Stephen Casper, Taylor Killian Published: 2022-09-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2022-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | 1 |
| Improving alignment of dialogue agents via targeted human judgements Abigail See, Amelia Glaese, Boxi Wu, Charlie Chen Published: 2022-09-28Area: Alignment TrainingCitations: 649 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2022-09-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 649 |
| Adversarial Policies Beat Superhuman Go AIs Adam Gleave, Joseph Miller, Kellin Pelrine, Michael D. Dennis Published: 2022-11-01Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 33 |
| Ignore Previous Prompt: Attack Techniques For Language Models F谩bio Perez, Ian Ribeiro Published: 2022-11-17Area: Adversarial RobustnessCitations: 675 Tags: adversarial-robustness, ai-safety, empirical | 2022-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 675 |
| Diagnostics for Deep Neural Networks with Automated Copy/Paste Attacks Dylan Hadfield-Menell, Kaivalya Hariharan, Stephen Casper Published: 2022-11-18Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2022-11-18 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 11 |
| Self-Destructing Models: Increasing the Costs of Harmful Dual Uses of Foundation Models Chelsea Finn, Christopher D. Manning, Dan Jurafsky, Eric Mitchell Published: 2022-11-27Area: Model EditingCitations: 65 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2022-11-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 65 |
| Fine-Tuning Is All You Need to Mitigate Backdoor Attacks Mathias Humbert, Pascal Berrang, Xinlei He, Yang Zhang Published: 2022-12-18Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2022-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 49 |
| Can Large Language Models Change User Preference Adversarially? Varshini Subhash Published: 2023-01-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-01-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 9 |
| Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity Chunyang Chen, Terry Yue Zhuo, Yujin Huang, Zhenchang Xing Published: 2023-01-30Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R5 (96%) | 137 |
| Adversarial Prompting for Black Box Foundation Models Eric Wong, Jacob Gardner, Natalie Maus, Patrick Chao Published: 2023-02-08Area: Adversarial RobustnessCitations: 77 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 77 |