Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Consequences of Misaligned AI Dylan Hadfield-Menell, Simon Zhuang Published: 2021-02-07Area: Formal/TheoreticalCitations: 95 Tags: ai-safety, formaltheoretical, theoretical | 2021-02-07 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E6 / R3 (96%) | 95 |
| Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models Bin He, Lei Li, Wenkai Yang, Xuancheng Ren Published: 2021-03-29Area: Adversarial RobustnessCitations: 171 Tags: adversarial-robustness, ai-safety, empirical | 2021-03-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 171 |
| Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors Bruno A Olshausen, Yann LeCun, Yubei Chen, Zeyu Yun Published: 2021-03-29Area: Mechanistic Interp.Citations: 113 Tags: ai-safety, empirical, mechanistic-interp | 2021-03-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (93%) | 113 |
| An Interpretability Illusion for BERT Adam Pearce, Andy Coenen, Ann Yuan, Emily Reif Published: 2021-04-14Area: Representation AnalysisCitations: 96 Tags: ai-safety, empirical, interpretability, representation-analysis | 2021-04-14 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (96%) | 96 |
| Gradient-based Adversarial Attacks against Text Transformers Alexandre Sablayrolles, Chuan Guo, Douwe Kiela, Herv茅 J茅gou Published: 2021-04-15Area: Adversarial RobustnessCitations: 302 Tags: adversarial-robustness, ai-safety, empirical | 2021-04-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 302 |
| Editing Factual Knowledge in Language Models Ivan Titov, Nicola De Cao, Wilker Aziz Published: 2021-04-16Area: Model EditingCitations: 636 Tags: ai-safety, empirical, model-editing | 2021-04-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 636 |
| Knowledge Neurons in Pretrained Transformers Baobao Chang, Damai Dai, Furu Wei, Li Dong Published: 2021-04-18Area: Mechanistic Interp.Citations: 601 Tags: ai-safety, empirical, mechanistic-interp | 2021-04-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 601 |
| DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts Alisa Liu, Chandra Bhagavatula, Maarten Sap, Noah A. Smith Published: 2021-05-07Area: Model EditingCitations: 459 Tags: ai-safety, empirical, model-editing | 2021-05-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 459 |
| Goal Misgeneralization in Deep Reinforcement Learning David Krueger, Jack Koch, Jacob Pfau, Laurent Orseau Published: 2021-05-28Area: Deception & FailureCitations: 115 Tags: ai-safety, deception-failure, empirical | 2021-05-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 115 |
| LoRA: Low-Rank Adaptation of Large Language Models Edward J. Hu, Lu Wang, Phillip Wallis, Shean Wang Published: 2021-06-17Area: Alignment TrainingCitations: 16470 Tags: ai-safety, alignment-training, empirical | 2021-06-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 16470 |
| Poisoning and Backdooring Contrastive Learning Andreas Terzis, Nicholas Carlini Published: 2021-06-17Area: Adversarial RobustnessCitations: 202 Tags: adversarial-robustness, ai-safety, empirical | 2021-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 202 |
| Process for Adapting Language Models to Society (PALMS) with Values-Targeted Datasets Christy Dennison, Irene Solaiman Published: 2021-06-18Area: Alignment TrainingCitations: 259 Tags: ai-safety, alignment-training, empirical | 2021-06-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 259 |
| Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling A. Stevie Bergman, Dirk Hovy, Emily Dinan, Gavin Abercrombie Published: 2021-07-07Area: Safety EvaluationCitations: 115 Tags: ai-safety, safety-evaluation, tool | 2021-07-07 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (93%) | 115 |
| Neuron-level Interpretation of Deep NLP Models: A Survey Fahim Dalvi, Hassan Sajjad, Nadir Durrani Published: 2021-08-30Area: Representation AnalysisCitations: 97 Tags: ai-safety, representation-analysis, safety-evaluation, survey | 2021-08-30 | Representation Analysis | ai-safety, representation-analysis, safety-evaluation, survey | E5 / R3 (94%) | 97 |
| TruthfulQA: Measuring How Models Mimic Human Falsehoods Jacob Hilton, Owain Evans, Stephanie Lin Published: 2021-09-08Area: Safety EvaluationCitations: 2869 Tags: ai-safety, benchmark, safety-evaluation | 2021-09-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 2869 |
| Recursively Summarizing Books with Human Feedback Daniel M. Ziegler, Jan Leike, Jeff Wu, Long Ouyang Published: 2021-09-22Area: Scalable OversightCitations: 349 Tags: ai-safety, empirical, scalable-oversight | 2021-09-22 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R4 (95%) | 349 |
| Unsolved Problems in ML Safety Dan Hendrycks, Jacob Steinhardt, John Schulman, Nicholas Carlini Published: 2021-09-28Area: Surveys & ReviewsCitations: 359 Tags: ai-safety, alignment-training, position, surveys-reviews | 2021-09-28 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R3 (95%) | 359 |
| Robust Feature-Level Adversaries are Interpretability Tools Dylan Hadfield-Menell, Gabriel Kreiman, Max Nadeau, Stephen Casper Published: 2021-10-07Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2021-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E5 / R3 (94%) | 34 |
| Truthful AI: Developing and Governing AI That Does Not Lie Adam Bales, Avital Balwit, Luca Righetti, Lukas Finnveden Published: 2021-10-13Area: Alignment TrainingCitations: 140 Tags: ai-safety, alignment-training, position | 2021-10-13 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | 140 |
| Can Machines Learn Morality? The Delphi Experiment Chandra Bhagavatula, Jena D. Hwang, Jenny Liang, Jesse Dodge Published: 2021-10-14Area: Alignment TrainingCitations: 157 Tags: ai-safety, alignment-training, empirical | 2021-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 157 |
| On the Pitfalls of Analyzing Individual Neurons in Language Models Omer Antverg, Yonatan Belinkov Published: 2021-10-14Area: Representation AnalysisCitations: 63 Tags: ai-safety, empirical, representation-analysis | 2021-10-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (95%) | 63 |
| BBQ: A Hand-Built Bias Benchmark for Question Answering Alicia Parrish, Angelica Chen, Jana Thompson, Jason Phang Published: 2021-10-15Area: Safety EvaluationCitations: 643 Tags: ai-safety, benchmark, safety-evaluation | 2021-10-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 643 |
| Fast Model Editing at Scale Antoine Bosselut, Charles Lin, Chelsea Finn, Christopher D. Manning Published: 2021-10-21Area: Model EditingCitations: 491 Tags: ai-safety, empirical, model-editing | 2021-10-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 491 |
| What Would Jiminy Cricket Do? Towards Agents That Behave Morally Andy Zou, Bo Li, Christine Zhu, Dan Hendrycks Published: 2021-10-25Area: Agent SafetyCitations: 72 Tags: agent-safety, ai-safety, benchmark | 2021-10-25 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (93%) | 72 |
| Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models Ahmed Hassan Awadallah, Bo Li, Boxin Wang, Chejian Xu Published: 2021-11-04Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2021-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E8 / R3 (95%) | 284 |
| Do Language Models Have Beliefs? Methods for Detecting, Updating, and Visualizing Model Beliefs Asli Celikyilmaz, Mohit Bansal, Mona Diab, Peter Hase Published: 2021-11-26Area: Model EditingCitations: 89 Tags: ai-safety, empirical, model-editing | 2021-11-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 89 |
| A General Language Assistant as a Laboratory for Alignment Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2021-12-01Area: Alignment TrainingCitations: 1016 Tags: ai-safety, alignment-training, empirical | 2021-12-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1016 |
| Inducing Causal Structure for Interpretable Neural Networks Atticus Geiger, Christopher Potts, Elisa Kreiss, Hanson Lu Published: 2021-12-01Area: Mechanistic Interp.Citations: 95 Tags: ai-safety, empirical, mechanistic-interp | 2021-12-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (97%) | 95 |
| Causal Distillation for Language Models Atticus Geiger, Christopher Potts, Elisa Kreiss, Hanson Lu Published: 2021-12-05Area: Mechanistic Interp.Citations: 29 Tags: ai-safety, empirical, mechanistic-interp | 2021-12-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (97%) | 29 |
| Taxonomy of Risks posed by Language Models Abeba Birhane, Amelia Glaese, Atoosa Kasirzadeh, Borja Balle Published: 2021-12-08Area: Surveys & ReviewsCitations: 1366 Tags: ai-safety, survey, surveys-reviews | 2021-12-08 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R6 (98%) | 1366 |