Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Large Language Model Unlearning Xiaojun Xu, Yang Liu, Yuanshun Yao Published: 2023-10-14Area: Model EditingCitations: 248 Tags: ai-safety, empirical, model-editing | 2023-10-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (92%) | 248 |
| In-Context Unlearning: Language Models as Few Shot Unlearners Himabindu Lakkaraju, Martin Pawelczyk, Seth Neel Published: 2023-10-11Area: Model EditingCitations: 197 Tags: ai-safety, empirical, model-editing | 2023-10-11 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 197 |
| Who's Harry Potter? Approximate Unlearning in LLMs Mark Russinovich, Ronen Eldan Published: 2023-10-03Area: Model EditingCitations: 335 Tags: ai-safety, empirical, model-editing | 2023-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 335 |
| Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks Mohit Bansal, Peter Hase, Vaidehi Patil Published: 2023-09-29Area: Model EditingCitations: 154 Tags: ai-safety, empirical, model-editing | 2023-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 154 |
| Knowledge Sanitization of Large Language Models Hidetoshi Shimodaira, Yoichi Ishibashi Published: 2023-09-21Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2023-09-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 37 |
| Circuit Breaking: Removing Model Behaviors with Targeted Ablation Maximilian Li, Max Nadeau, Xander Davies Published: 2023-09-12Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2023-09-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (94%) | 34 |
| Unified Concept Editing in Diffusion Models David Bau, Hadas Orgad, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-08-25Area: Model EditingCitations: 320 Tags: ai-safety, empirical, model-editing | 2023-08-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 320 |
| Precise Model Editing in a Transformer (PMET) Jie Yu, Jing Yang, Jun Ma, Shasha Li Published: 2023-08-17Area: Model EditingCitations: 190 Tags: ai-safety, empirical, model-editing | 2023-08-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 190 |
| Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation Baotian Hu, Dongfang Li, Min Zhang, Xinshuo Hu Published: 2023-08-16Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2023-08-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | 40 |
| EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models Bozhong Tian, Guozhou Zheng, Huajun Chen, Kangwei Liu Published: 2023-08-14Area: Model EditingCitations: 86 Tags: ai-safety, model-editing, safety-evaluation, tool | 2023-08-14 | Model Editing | ai-safety, model-editing, safety-evaluation, tool | E6 / R4 (97%) | 86 |
| Evaluating the Ripple Effects of Knowledge Editing in Language Models Amir Globerson, Eden Biran, Mor Geva, Ori Yoran Published: 2023-07-24Area: Model EditingCitations: 241 Tags: ai-safety, benchmark, model-editing | 2023-07-24 | Model Editing | ai-safety, benchmark, model-editing | E4 / R3 (94%) | 241 |
| MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions Christopher D. Manning, Christopher Potts, Danqi Chen, Zexuan Zhong Published: 2023-05-24Area: Model EditingCitations: 288 Tags: ai-safety, benchmark, model-editing | 2023-05-24 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 288 |
| Can We Edit Factual Knowledge by In-Context Learning? Baobao Chang, Ce Zheng, Jingjing Xu, Lei Li Published: 2023-05-22Area: Model EditingCitations: 299 Tags: ai-safety, empirical, model-editing | 2023-05-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 299 |
| Editing Large Language Models: Problems, Methods, and Opportunities Bozhong Tian, Huajun Chen, Ningyu Zhang, Peng Wang Published: 2023-05-22Area: Model EditingCitations: 417 Tags: ai-safety, model-editing, survey | 2023-05-22 | Model Editing | ai-safety, model-editing, survey | E8 / R3 (97%) | 417 |
| Data Redaction from Conditional Generative Models Kamalika Chaudhuri, Zhifeng Kong Published: 2023-05-18Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2023-05-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 9 |
| KGA: A General Machine Unlearning Framework Based on Knowledge Gap Alignment Hongzhi Yin, Kam-Fai Wong, Lingzhi Wang, Tong Chen Published: 2023-05-11Area: Model EditingCitations: 100 Tags: ai-safety, alignment-training, empirical, model-editing | 2023-05-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E7 / R4 (96%) | 100 |
| Inspecting and Editing Knowledge Representations in Language Models Belinda Z. Li, Evan Hernandez, Jacob Andreas Published: 2023-04-03Area: Model EditingCitations: 130 Tags: ai-safety, empirical, model-editing | 2023-04-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 130 |
| Ablating Concepts in Text-to-Image Diffusion Models Bingliang Zhang, Eli Shechtman, Jun-Yan Zhu, Nupur Kumari Published: 2023-03-23Area: Model EditingCitations: 300 Tags: ai-safety, empirical, model-editing | 2023-03-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 300 |
| Erasing Concepts from Diffusion Models David Bau, Jaden Fiotto-Kaufman, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-03-13Area: Model EditingCitations: 469 Tags: ai-safety, empirical, model-editing | 2023-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 469 |
| Transformer-Patcher: One Mistake worth One Neuron Jie Zhou, Wenge Rong, Xiaofeng Zhang, Yikang Shen Published: 2023-01-24Area: Model EditingCitations: 217 Tags: ai-safety, empirical, model-editing | 2023-01-24 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 217 |
| Does Localization Inform Editing? Surprising Differences in Causality-Based Localization vs. Knowledge Editing in Language Models Asma Ghandeharioun, Been Kim, Mohit Bansal, Peter Hase Published: 2023-01-10Area: Model EditingCitations: 240 Tags: ai-safety, empirical, model-editing | 2023-01-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 240 |
| Editing Models with Task Arithmetic Ali Farhadi, Gabriel Ilharco, Hannaneh Hajishirzi, Ludwig Schmidt Published: 2022-12-08Area: Model EditingCitations: 828 Tags: ai-safety, empirical, model-editing | 2022-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 828 |
| Self-Destructing Models: Increasing the Costs of Harmful Dual Uses of Foundation Models Chelsea Finn, Christopher D. Manning, Dan Jurafsky, Eric Mitchell Published: 2022-11-27Area: Model EditingCitations: 65 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2022-11-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 65 |
| Aging with GRACE: Lifelong Model Editing with Discrete Key-Value Adaptors Hamid Palangi, Marzyeh Ghassemi, Swami Sankaranarayanan, Thomas Hartvigsen Published: 2022-11-20Area: Model EditingCitations: 251 Tags: ai-safety, empirical, model-editing | 2022-11-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 251 |
| Mass-Editing Memory in a Transformer Alex Andonian, Arnab Sen Sharma, David Bau, Kevin Meng Published: 2022-10-13Area: Model EditingCitations: 851 Tags: ai-safety, empirical, model-editing | 2022-10-13 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 851 |
| Knowledge Unlearning for Mitigating Privacy Risks in Language Models Dongkeun Yoon, Joel Jang, Lajanugen Logeswaran, Minjoon Seo Published: 2022-10-04Area: Model EditingCitations: 385 Tags: ai-safety, empirical, model-editing | 2022-10-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 385 |
| Memory-Based Model Editing at Scale Antoine Bosselut, Charles Lin, Chelsea Finn, Christopher D Manning Published: 2022-06-13Area: Model EditingCitations: 484 Tags: ai-safety, empirical, model-editing | 2022-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 484 |
| Locating and Editing Factual Associations in GPT Alex Andonian, David Bau, Kevin Meng, Yonatan Belinkov Published: 2022-02-10Area: Model EditingCitations: 2100 Tags: ai-safety, empirical, model-editing | 2022-02-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2100 |
| Towards Adversarial Evaluations for Inexact Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2022-01-17Area: Model EditingCitations: 79 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2022-01-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (93%) | 79 |
| Do Language Models Have Beliefs? Methods for Detecting, Updating, and Visualizing Model Beliefs Asli Celikyilmaz, Mohit Bansal, Mona Diab, Peter Hase Published: 2021-11-26Area: Model EditingCitations: 89 Tags: ai-safety, empirical, model-editing | 2021-11-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 89 |