Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SNAP: Unlearning Selective Knowledge in Large Language Models with Negative Instructions Daniel Rim, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-06-18Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 7 |
| Stealth edits for provably fixing or attacking large language models Alexander Bastounis, Alexander N. Gorban, Desmond J. Higham, Ivan Y. Tyukin Published: 2024-06-18Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 2 |
| Textual Unlearning Gives a False Sense of Unlearning Jiacheng Du, Jiahui Hu, Jie Zhang, Kui Ren Published: 2024-06-19Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | 9 |
| Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning Shengyuan Hu, Virginia Smith, Yiwei Fu, Zhiwei Steven Wu Published: 2024-06-19Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 40 |
| Steering Without Side Effects: Improving Post-Deployment Control of Language Models Alexander Lyzhov, Asa Cooper Stickland, Jacob Pfau, Salsabila Mahdi Published: 2024-06-21Area: Model EditingCitations: 41 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-06-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 41 |
| How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective Meghdad Kurmanji, Nicholas D. Lane, Nicola Cancedda, Pontus Stenetorp Published: 2024-06-24Area: Model EditingCitations: 1 Tags: ai-safety, benchmark, model-editing | 2024-06-24 | Model Editing | ai-safety, benchmark, model-editing | E6 / R4 (96%) | 1 |
| Enhancing Data Privacy in Large Language Models through Private Association Editing Andrea Favalli, Cristina Giannone, Davide Venditti, Elena Sofia Ruzzetti Published: 2024-06-26Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 7 |
| Evaluating Copyright Takedown Methods for Language Models Boyi Wei, Chiyuan Zhang, Kai Li, Luke Zettlemoyer Published: 2024-06-26Area: Model EditingCitations: 42 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-06-26 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 42 |
| Fundamental Problems With Model Editing: How Should Rational Belief Revision Work in LLMs? Elias Stengel-Eskin, Mohit Bansal, Peter Hase, Thomas Hofweber Published: 2024-06-27Area: Model EditingCitations: 24 Tags: ai-safety, model-editing, theoretical | 2024-06-27 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (96%) | 24 |
| UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI Eleni Triantafillou, Eugene Bagdasaryan, Guillermo Ortiz-Jimenez, Heidi Howard Published: 2024-06-27Area: Model EditingCitations: 50 Tags: ai-safety, model-editing, position | 2024-06-27 | Model Editing | ai-safety, model-editing, position | E5 / R3 (95%) | 50 |
| To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models Bozhong Tian, Dianbo Sui, Huajun Chen, Mengru Wang Published: 2024-07-02Area: Model EditingCitations: 23 Tags: ai-safety, benchmark, model-editing | 2024-07-02 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 23 |
| MUSE: Machine Unlearning Six-Way Evaluation for Language Models Ari Holtzman, Chiyuan Zhang, Daogao Liu, Jaechan Lee Published: 2024-07-08Area: Model EditingCitations: 174 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-07-08 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (97%) | 174 |
| Composable Interventions for Language Models Anurag Vaidya, Arinbj枚rn Kolbeinsson, Faisal Mahmood, Jonathan Richard Schwarz Published: 2024-07-09Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-07-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 5 |
| Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing Andrew Zhao, Gao Huang, Huanqian Wang, Jingxin Shi Published: 2024-07-11Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| Learning to Refuse: Towards Mitigating Privacy Risks in LLMs Chuanyuan Tan, Tong Zhu, Wenliang Chen, Zhenhua Liu Published: 2024-07-14Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 18 |
| On Large Language Model Continual Unlearning Chenkai Weng, Chongyang Gao, Kaize Ding, Lixu Wang Published: 2024-07-14Area: Model EditingCitations: 30 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 30 |
| Direct Unlearning Optimization for Robust and Safe Text-to-Image Models Gayoung Lee, Geonhui Jang, Jin-Hwa Kim, Junghyo Jo Published: 2024-07-17Area: Model EditingCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (95%) | 42 |
| Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective Shiyu Chang, Tommi Jaakkola, Yang Zhang, Yujian Liu Published: 2024-07-24Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-07-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 28 |
| Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models Enhong Chen, Haoyu Tang, Kai Zhang, Qi Liu Published: 2024-07-25Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-07-25 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 7 |
| Editing LLMs Can Stealthily Subvert Safety Baixiang Huang, Canyu Chen, Chaowei Xiao, Dawn Song Published: 2024-07-29Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-07-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | 24 |
| Machine Unlearning in Generative AI: A Survey Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-07-30Area: Model EditingCitations: 47 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-07-30 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R3 (95%) | 47 |
| On the Limitations and Prospects of Machine Unlearning for Generative AI Heng Chang, Jiangnan Ye, Lianzhe Wang, Shiji Zhou Published: 2024-08-01Area: Model EditingCitations: 14 Tags: ai-safety, model-editing, position, safety-evaluation | 2024-08-01 | Model Editing | ai-safety, model-editing, position, safety-evaluation | E5 / R4 (96%) | 14 |
| Get Confused Cautiously: Textual Sequence Memorization Erasure with Selective Entropy Maximization Ioannis Patras, Zhaohan Zhang, Ziquan Liu Published: 2024-08-09Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2024-08-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 8 |
| On Effects of Steering Latent Representation for Large Language Model Unlearning Dang Huu-Tien, Hoang Thanh-Tung, Naoya Inoue, Trung-Tin Pham Published: 2024-08-12Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2024-08-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| Towards Robust and Parameter-Efficient Knowledge Unlearning for LLMs Dasol Hwang, Moontae Lee, Sungjun Cho, Sungmin Cha Published: 2024-08-13Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-08-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (97%) | 23 |
| Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models Hongbang Yuan, Jun Zhao, Kang Liu, Pengfei Cao Published: 2024-08-20Area: Model EditingCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-08-20 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (92%) | 25 |
| SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering Hai Zhao, Yifei Yang, Zouying Cao Published: 2024-08-21Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-08-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 24 |
| Unforgettable Generalization in Language Models Eric Zhang, Jacob Andreas, Leshem Choshen Published: 2024-09-03Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-09-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 4 |
| Programming Refusal with Conditional Activation Steering Amit Dhurandhar, Bruce W. Lee, Erik Miehling, Inkit Padhi Published: 2024-09-06Area: Model EditingCitations: 87 Tags: ai-safety, empirical, model-editing | 2024-09-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 87 |
| Representation Tuning Christopher M. Ackerman Published: 2024-09-11Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-09-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |