Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 672 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Natural Adversarial Examples Dan Hendrycks, Dawn Song, Jacob Steinhardt, Kevin Zhao Published: 2019-07-16Area: Adversarial RobustnessCitations: 1794 Tags: adversarial-robustness, ai-safety, dataset | 2019-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (95%) | 1794 |
| Optimal Policies Tend to Seek Power Alexander Matt Turner, Andrew Critch, Logan Smith, Prasad Tadepalli Published: 2019-12-03Area: Formal/TheoreticalCitations: 97 Tags: ai-safety, formaltheoretical, theoretical | 2019-12-03 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (93%) | 97 |
| Scaling Laws for Neural Language Models Alec Radford, Benjamin Chess, Dario Amodei, Jared Kaplan Published: 2020-01-23Area: Training DynamicsCitations: 7093 Tags: ai-safety, empirical, training-dynamics | 2020-01-23 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R4 (96%) | 7093 |
| On Adaptive Attacks to Adversarial Example Defenses Aleksander Madry, Florian Tramer, Nicholas Carlini, Wieland Brendel Published: 2020-02-19Area: Adversarial RobustnessCitations: 921 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2020-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E9 / R3 (98%) | 921 |
| A Primer in BERTology: What We Know About How BERT Works Anna Rogers, Anna Rumshisky, Olga Kovaleva Published: 2020-02-27Area: Surveys & ReviewsCitations: 1772 Tags: ai-safety, interpretability, survey, surveys-reviews | 2020-02-27 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E5 / R4 (94%) | 1772 |
| Editable Neural Networks Anton Sinitsin, Artem Babenko, Dmitriy Pyrkin, Sergei Popov Published: 2020-04-01Area: Model EditingCitations: 204 Tags: ai-safety, empirical, model-editing | 2020-04-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 204 |
| Weight Poisoning Attacks on Pretrained Models Graham Neubig, Keita Kurita, Paul Michel Published: 2020-04-14Area: Adversarial RobustnessCitations: 551 Tags: adversarial-robustness, ai-safety, empirical | 2020-04-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 551 |
| AI Research Considerations for Human Existential Safety (ARCHES) Andrew Critch, David Krueger Published: 2020-05-30Area: Surveys & ReviewsCitations: 65 Tags: ai-safety, position, surveys-reviews | 2020-05-30 | Surveys & Reviews | ai-safety, position, surveys-reviews | E5 / R3 (97%) | 65 |
| Compositional Explanations of Neurons Jacob Andreas, Jesse Mu Published: 2020-06-24Area: Mechanistic Interp.Citations: 206 Tags: ai-safety, empirical, mechanistic-interp | 2020-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 206 |
| Measuring Robustness to Natural Distribution Shifts in Image Classification Achal Dave, Benjamin Recht, Ludwig Schmidt, Nicholas Carlini Published: 2020-07-01Area: Adversarial RobustnessCitations: 644 Tags: adversarial-robustness, ai-safety, benchmark | 2020-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (95%) | 644 |
| You Autocomplete Me: Poisoning Vulnerabilities in Neural Code Completion Congzheng Song, Eran Tromer, Roei Schuster, Vitaly Shmatikov Published: 2020-07-05Area: Adversarial RobustnessCitations: 190 Tags: adversarial-robustness, ai-safety, empirical | 2020-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 190 |
| Aligning AI With Shared Human Values Andrew Critch, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-08-05Area: Safety EvaluationCitations: 810 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2020-08-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R5 (94%) | 810 |
| Learning to summarize from human feedback Alec Radford, Chelsea Voss, Daniel M. Ziegler, Dario Amodei Published: 2020-09-02Area: Alignment TrainingCitations: 2862 Tags: ai-safety, alignment-training, empirical | 2020-09-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (98%) | 2862 |
| Measuring Massive Multitask Language Understanding Andy Zou, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-09-07Area: Safety EvaluationCitations: 7081 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 7081 |
| Understanding the Role of Individual Units in a Deep Neural Network Agata Lapedriza, Antonio Torralba, Bolei Zhou, David Bau Published: 2020-09-10Area: Mechanistic Interp.Citations: 505 Tags: ai-safety, empirical, mechanistic-interp | 2020-09-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 505 |
| The Radicalization Risks of GPT-3 and Advanced Neural Language Models Alex Newhouse, Kris McGuffie Published: 2020-09-15Area: Safety EvaluationCitations: 164 Tags: ai-safety, empirical, safety-evaluation | 2020-09-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | 164 |
| Hidden Incentives for Auto-Induced Distributional Shift David Krueger, Jan Leike, Tegan Maharaj Published: 2020-09-19Area: Deception & FailureCitations: 56 Tags: ai-safety, deception-failure, empirical | 2020-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 56 |
| RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models Maarten Sap, Noah A. Smith, Samuel Gehman, Suchin Gururangan Published: 2020-09-24Area: Safety EvaluationCitations: 1530 Tags: ai-safety, benchmark, safety-evaluation | 2020-09-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 1530 |
| Analyzing Individual Neurons in Pre-trained Language Models Fahim Dalvi, Hassan Sajjad, Nadir Durrani, Yonatan Belinkov Published: 2020-10-06Area: Representation AnalysisCitations: 120 Tags: ai-safety, empirical, representation-analysis | 2020-10-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (96%) | 120 |
| RobustBench: a standardized adversarial robustness benchmark Edoardo Debenedetti, Francesco Croce, Maksym Andriushchenko, Matthias Hein Published: 2020-10-19Area: Adversarial RobustnessCitations: 836 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2020-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | 836 |
| Deep Learning is Singular, and That's Good Daniel Murfet, Hui Li, Jesse Gell-Redman, Mingming Gong Published: 2020-10-22Area: Formal/TheoreticalCitations: 38 Tags: ai-safety, formaltheoretical, theoretical | 2020-10-22 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (95%) | 38 |
| Towards Falsifiable Interpretability Research Ari S. Morcos, Matthew L. Leavitt Published: 2020-10-22Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, interpretability, mechanistic-interp, position | 2020-10-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E6 / R4 (97%) | 74 |
| Concealed Data Poisoning Attacks on NLP Models Eric Wallace, Sameer Singh, Shi Feng, Tony Z. Zhao Published: 2020-10-23Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2020-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (94%) | 20 |
| Avoiding Tampering Incentives in Deep RL via Decoupled Approval Jonathan Uesato, Ramana Kumar, Richard Ngo, Shane Legg Published: 2020-11-17Area: Agent SafetyCitations: 18 Tags: agent-safety, ai-safety, empirical | 2020-11-17 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (94%) | 18 |
| Modifying Memories in Transformer Models Ankit Singh Rawat, Chen Zhu, Daliang Li, Felix Yu Published: 2020-12-01Area: Model EditingCitations: 256 Tags: ai-safety, empirical, model-editing | 2020-12-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 256 |
| An Overview of 11 Proposals for Building Safe Advanced AI Evan Hubinger Published: 2020-12-04Area: Surveys & ReviewsCitations: 27 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2020-12-04 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E7 / R3 (97%) | 27 |
| Extracting Training Data from Large Language Models Adam Roberts, Alina Oprea, Ariel Herbert-Voss, Colin Raffel Published: 2020-12-14Area: Adversarial RobustnessCitations: 2624 Tags: adversarial-robustness, ai-safety, empirical | 2020-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2624 |
| WILDS: A Benchmark of in-the-Wild Distribution Shifts Akshay Balsubramani, Anshul Kundaje, Berton A. Earnshaw, Chelsea Finn Published: 2020-12-14Area: Safety EvaluationCitations: 1690 Tags: ai-safety, benchmark, safety-evaluation | 2020-12-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (99%) | 1690 |
| Open Problems in Cooperative AI Allan Dafoe, Edward Hughes, Joel Z. Leibo, Kate Larson Published: 2020-12-15Area: Agent SafetyCitations: 239 Tags: agent-safety, ai-safety, position | 2020-12-15 | Agent Safety | agent-safety, ai-safety, position | E6 / R5 (93%) | 239 |
| Agent Incentives: A Causal Perspective Eric D. Langlois, Pedro A. Ortega, Ryan Carey, Shane Legg Published: 2021-02-02Area: Formal/TheoreticalCitations: 61 Tags: ai-safety, formaltheoretical, theoretical | 2021-02-02 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E6 / R3 (96%) | 61 |