Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Knowledge Sanitization of Large Language Models Hidetoshi Shimodaira, Yoichi Ishibashi Published: 2023-09-21Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2023-09-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 37 |
| Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks Mohit Bansal, Peter Hase, Vaidehi Patil Published: 2023-09-29Area: Model EditingCitations: 154 Tags: ai-safety, empirical, model-editing | 2023-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 154 |
| Who's Harry Potter? Approximate Unlearning in LLMs Mark Russinovich, Ronen Eldan Published: 2023-10-03Area: Model EditingCitations: 335 Tags: ai-safety, empirical, model-editing | 2023-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 335 |
| In-Context Unlearning: Language Models as Few Shot Unlearners Himabindu Lakkaraju, Martin Pawelczyk, Seth Neel Published: 2023-10-11Area: Model EditingCitations: 197 Tags: ai-safety, empirical, model-editing | 2023-10-11 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 197 |
| Large Language Model Unlearning Xiaojun Xu, Yang Liu, Yuanshun Yao Published: 2023-10-14Area: Model EditingCitations: 248 Tags: ai-safety, empirical, model-editing | 2023-10-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (92%) | 248 |
| SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation Chongyu Fan, Dennis Wei, Eric Wong, Jiancheng Liu Published: 2023-10-19Area: Model EditingCitations: 290 Tags: ai-safety, empirical, model-editing | 2023-10-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 290 |
| DEPN: Detecting and Editing Privacy Neurons in Pretrained Language Models Chao Bian, Deyi Xiong, Junzhuo Li, Minghui Xu Published: 2023-10-31Area: Model EditingCitations: 85 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (96%) | 85 |
| Unlearn What You Want to Forget: Efficient Unlearning for LLMs Diyi Yang, Jiaao Chen Published: 2023-10-31Area: Model EditingCitations: 231 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 231 |
| Do Localization Methods Actually Localize Memorized Data in LLMs? A Tale of Two Benchmarks Jesse Thomason, Robin Jia, Ting-Yun Chang Published: 2023-11-15Area: Model EditingCitations: 26 Tags: ai-safety, benchmark, model-editing | 2023-11-15 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (93%) | 26 |
| DUnE: Dataset for Unified Editing Afra Feyza Aky眉rek, Derry Wijaya, Eric Pan, Garry Kuwanto Published: 2023-11-27Area: Model EditingCitations: 20 Tags: ai-safety, benchmark, model-editing | 2023-11-27 | Model Editing | ai-safety, benchmark, model-editing | E5 / R4 (95%) | 20 |
| Knowledge Unlearning for LLMs: Tasks, Methods, and Challenges Dan Qu, Hao Zhang, Heyu Chang, Nianwen Si Published: 2023-11-27Area: Model EditingCitations: 41 Tags: ai-safety, model-editing, safety-evaluation, survey | 2023-11-27 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R5 (95%) | 41 |
| A Comprehensive Study of Knowledge Editing for Large Language Models Bozhong Tian, Fei Huang, Huajun Chen, Jia-Chen Gu Published: 2024-01-02Area: Model EditingCitations: 134 Tags: ai-safety, model-editing, survey | 2024-01-02 | Model Editing | ai-safety, model-editing, survey | E5 / R3 (95%) | 134 |
| EraseDiff: Erasing Data Influence in Diffusion Models Jing Wu, Mehrtash Harandi, Munawar Hayat, Trung Le Published: 2024-01-11Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-01-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 28 |
| InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance Botian Jiang, Chenkun Tan, Dong Zhang, Ke Ren Published: 2024-01-20Area: Model EditingCitations: 78 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-01-20 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 78 |
| Rethinking Machine Unlearning for Large Language Models Chris Yuhao Liu, Hang Li, Jinghan Jia, Kush R. Varshney Published: 2024-02-13Area: Model EditingCitations: 227 Tags: ai-safety, alignment-training, model-editing, safety-evaluation, survey | 2024-02-13 | Model Editing | ai-safety, alignment-training, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 227 |
| Towards Safer Large Language Models through Machine Unlearning Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-02-15Area: Model EditingCitations: 134 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 134 |
| UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models Hongzhou Lin, Ivan Vulic, Mikhail Belkin, Ramon Huerta Published: 2024-02-15Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 23 |
| UnlearnCanvas: A Stylized Image Dataset to Benchmark Machine Unlearning for Diffusion Models Jiancheng Liu, Jinghan Jia, Sijia Liu, Xiaoming Liu Published: 2024-02-19Area: Model EditingCitations: 22 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-02-19 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (96%) | 22 |
| Corrective Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2024-02-21Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 23 |
| Dissecting Language Models: Machine Unlearning via Selective Pruning Nandi Schoots, Nicholas Pochinkov Published: 2024-03-02Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2024-03-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 34 |
| Guardrail Baselines for Unlearning in LLMs Pratiksha Thaker, Virginia Smith, Yash Maurya Published: 2024-03-05Area: Model EditingCitations: 84 Tags: ai-safety, empirical, model-editing | 2024-03-05 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 84 |
| Extending Activation Steering to Broad Skills and Multiple Behaviours Massimo Poesio, Nandi Schoots, Teun van der Weij Published: 2024-03-09Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-03-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | 26 |
| MACE: Mass Concept Erasure in Diffusion Models Adams Wai-Kin Kong, Leyang Li, Shilin Lu, Yanzhu Liu Published: 2024-03-10Area: Model EditingCitations: 232 Tags: ai-safety, empirical, model-editing | 2024-03-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 232 |
| Ethos: Rectifying Language Models in Orthogonal Parameter Space Lei Gao, Murali Annavaram, Salman Avestimehr, Tingting Tang Published: 2024-03-13Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 20 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| Hiding and Recovering Knowledge in Text-to-Image Diffusion Models via Learnable Prompts Anh Bui, Dinh Phung, Khanh Doan, Paul Montague Published: 2024-03-18Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-03-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| Detoxifying Large Language Models via Knowledge Editing Huajun Chen, Jindong Wang, Linyi Yang, Mengru Wang Published: 2024-03-21Area: Model EditingCitations: 93 Tags: ai-safety, empirical, model-editing | 2024-03-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 93 |
| NL-ITI: Optimizing Probing and Intervention for Improvement of ITI Method Adam Cieslak, Adam Wiacek, Artur Janicki, Jakub Hoscilowicz Published: 2024-03-27Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-03-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 5 |
| Digital Forgetting in Large Language Models: A Survey of Unlearning Methods Alberto Blanco-Justicia, Benet Manzanares, David S谩nchez, Guillem Collell Published: 2024-04-02Area: Model EditingCitations: 45 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-04-02 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (96%) | 45 |
| Locating and Editing Factual Associations in Mamba Arnab Sen Sharma, David Atkinson, David Bau Published: 2024-04-04Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 37 |