Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 124 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Scaling Laws for Neural Language Models Alec Radford, Benjamin Chess, Dario Amodei, Jared Kaplan Published: 2020-01-23Area: Training DynamicsCitations: 7093 Tags: ai-safety, empirical, training-dynamics | 2020-01-23 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R4 (96%) | 7093 |
| On Adaptive Attacks to Adversarial Example Defenses Aleksander Madry, Florian Tramer, Nicholas Carlini, Wieland Brendel Published: 2020-02-19Area: Adversarial RobustnessCitations: 921 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2020-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E9 / R3 (98%) | 921 |
| Editable Neural Networks Anton Sinitsin, Artem Babenko, Dmitriy Pyrkin, Sergei Popov Published: 2020-04-01Area: Model EditingCitations: 204 Tags: ai-safety, empirical, model-editing | 2020-04-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 204 |
| Weight Poisoning Attacks on Pretrained Models Graham Neubig, Keita Kurita, Paul Michel Published: 2020-04-14Area: Adversarial RobustnessCitations: 551 Tags: adversarial-robustness, ai-safety, empirical | 2020-04-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 551 |
| Compositional Explanations of Neurons Jacob Andreas, Jesse Mu Published: 2020-06-24Area: Mechanistic Interp.Citations: 206 Tags: ai-safety, empirical, mechanistic-interp | 2020-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 206 |
| You Autocomplete Me: Poisoning Vulnerabilities in Neural Code Completion Congzheng Song, Eran Tromer, Roei Schuster, Vitaly Shmatikov Published: 2020-07-05Area: Adversarial RobustnessCitations: 190 Tags: adversarial-robustness, ai-safety, empirical | 2020-07-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 190 |
| Learning to summarize from human feedback Alec Radford, Chelsea Voss, Daniel M. Ziegler, Dario Amodei Published: 2020-09-02Area: Alignment TrainingCitations: 2862 Tags: ai-safety, alignment-training, empirical | 2020-09-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (98%) | 2862 |
| Understanding the Role of Individual Units in a Deep Neural Network Agata Lapedriza, Antonio Torralba, Bolei Zhou, David Bau Published: 2020-09-10Area: Mechanistic Interp.Citations: 505 Tags: ai-safety, empirical, mechanistic-interp | 2020-09-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 505 |
| The Radicalization Risks of GPT-3 and Advanced Neural Language Models Alex Newhouse, Kris McGuffie Published: 2020-09-15Area: Safety EvaluationCitations: 164 Tags: ai-safety, empirical, safety-evaluation | 2020-09-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | 164 |
| Hidden Incentives for Auto-Induced Distributional Shift David Krueger, Jan Leike, Tegan Maharaj Published: 2020-09-19Area: Deception & FailureCitations: 56 Tags: ai-safety, deception-failure, empirical | 2020-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 56 |
| Analyzing Individual Neurons in Pre-trained Language Models Fahim Dalvi, Hassan Sajjad, Nadir Durrani, Yonatan Belinkov Published: 2020-10-06Area: Representation AnalysisCitations: 120 Tags: ai-safety, empirical, representation-analysis | 2020-10-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (96%) | 120 |
| Concealed Data Poisoning Attacks on NLP Models Eric Wallace, Sameer Singh, Shi Feng, Tony Z. Zhao Published: 2020-10-23Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2020-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (94%) | 20 |
| Avoiding Tampering Incentives in Deep RL via Decoupled Approval Jonathan Uesato, Ramana Kumar, Richard Ngo, Shane Legg Published: 2020-11-17Area: Agent SafetyCitations: 18 Tags: agent-safety, ai-safety, empirical | 2020-11-17 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (94%) | 18 |
| Modifying Memories in Transformer Models Ankit Singh Rawat, Chen Zhu, Daliang Li, Felix Yu Published: 2020-12-01Area: Model EditingCitations: 256 Tags: ai-safety, empirical, model-editing | 2020-12-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 256 |
| Extracting Training Data from Large Language Models Adam Roberts, Alina Oprea, Ariel Herbert-Voss, Colin Raffel Published: 2020-12-14Area: Adversarial RobustnessCitations: 2624 Tags: adversarial-robustness, ai-safety, empirical | 2020-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2624 |
| Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models Bin He, Lei Li, Wenkai Yang, Xuancheng Ren Published: 2021-03-29Area: Adversarial RobustnessCitations: 171 Tags: adversarial-robustness, ai-safety, empirical | 2021-03-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 171 |
| Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors Bruno A Olshausen, Yann LeCun, Yubei Chen, Zeyu Yun Published: 2021-03-29Area: Mechanistic Interp.Citations: 113 Tags: ai-safety, empirical, mechanistic-interp | 2021-03-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (93%) | 113 |
| An Interpretability Illusion for BERT Adam Pearce, Andy Coenen, Ann Yuan, Emily Reif Published: 2021-04-14Area: Representation AnalysisCitations: 96 Tags: ai-safety, empirical, interpretability, representation-analysis | 2021-04-14 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (96%) | 96 |
| Gradient-based Adversarial Attacks against Text Transformers Alexandre Sablayrolles, Chuan Guo, Douwe Kiela, Herv茅 J茅gou Published: 2021-04-15Area: Adversarial RobustnessCitations: 302 Tags: adversarial-robustness, ai-safety, empirical | 2021-04-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 302 |
| Editing Factual Knowledge in Language Models Ivan Titov, Nicola De Cao, Wilker Aziz Published: 2021-04-16Area: Model EditingCitations: 636 Tags: ai-safety, empirical, model-editing | 2021-04-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 636 |
| Knowledge Neurons in Pretrained Transformers Baobao Chang, Damai Dai, Furu Wei, Li Dong Published: 2021-04-18Area: Mechanistic Interp.Citations: 601 Tags: ai-safety, empirical, mechanistic-interp | 2021-04-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 601 |
| DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts Alisa Liu, Chandra Bhagavatula, Maarten Sap, Noah A. Smith Published: 2021-05-07Area: Model EditingCitations: 459 Tags: ai-safety, empirical, model-editing | 2021-05-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 459 |
| Goal Misgeneralization in Deep Reinforcement Learning David Krueger, Jack Koch, Jacob Pfau, Laurent Orseau Published: 2021-05-28Area: Deception & FailureCitations: 115 Tags: ai-safety, deception-failure, empirical | 2021-05-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 115 |
| LoRA: Low-Rank Adaptation of Large Language Models Edward J. Hu, Lu Wang, Phillip Wallis, Shean Wang Published: 2021-06-17Area: Alignment TrainingCitations: 16470 Tags: ai-safety, alignment-training, empirical | 2021-06-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 16470 |
| Poisoning and Backdooring Contrastive Learning Andreas Terzis, Nicholas Carlini Published: 2021-06-17Area: Adversarial RobustnessCitations: 202 Tags: adversarial-robustness, ai-safety, empirical | 2021-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 202 |
| Process for Adapting Language Models to Society (PALMS) with Values-Targeted Datasets Christy Dennison, Irene Solaiman Published: 2021-06-18Area: Alignment TrainingCitations: 259 Tags: ai-safety, alignment-training, empirical | 2021-06-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 259 |
| Recursively Summarizing Books with Human Feedback Daniel M. Ziegler, Jan Leike, Jeff Wu, Long Ouyang Published: 2021-09-22Area: Scalable OversightCitations: 349 Tags: ai-safety, empirical, scalable-oversight | 2021-09-22 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R4 (95%) | 349 |
| Robust Feature-Level Adversaries are Interpretability Tools Dylan Hadfield-Menell, Gabriel Kreiman, Max Nadeau, Stephen Casper Published: 2021-10-07Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2021-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E5 / R3 (94%) | 34 |
| Can Machines Learn Morality? The Delphi Experiment Chandra Bhagavatula, Jena D. Hwang, Jenny Liang, Jesse Dodge Published: 2021-10-14Area: Alignment TrainingCitations: 157 Tags: ai-safety, alignment-training, empirical | 2021-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 157 |
| On the Pitfalls of Analyzing Individual Neurons in Language Models Omer Antverg, Yonatan Belinkov Published: 2021-10-14Area: Representation AnalysisCitations: 63 Tags: ai-safety, empirical, representation-analysis | 2021-10-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (95%) | 63 |