Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Not All Tokens Are Meant to Be Forgotten Dongxiao Zhu, Douglas Zytko, Prashant Khanduri, Saleh Zare Zade Published: 2025-06-03Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-06-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | 2 |
| Distillation Robustifies Unlearning Addie Foote, Alexander Matt Turner, Alex Cloud, Alex Infanger Published: 2025-06-06Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 6 |
| Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness Eli Chien, Hans Hao-Hsun Hsu, Haoteng Yin, Kamalika Chaudhuri Published: 2025-06-06Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 9 |
| Towards Lifecycle Unlearning Commitment Management: Measuring Sample-level Unlearning Completeness Cheng-Long Wang, Di Wang, Qi Li, Yinzhi Cao Published: 2025-06-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 4 |
| RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality Chenlong Zhang, Hongbang Yuan, Jiaheng Wei, Jun Zhao Published: 2025-06-08Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-06-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 5 |
| BLUR: A Bi-Level Optimization Approach for LLM Unlearning Anil Ramakrishna, Bhanukiran Vinzamuri, Hadi Reisizadeh, Jinghan Jia Published: 2025-06-09Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-06-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 5 |
| LLM Unlearning Should Be Form-Independent Mengqi Zhang, Shu Wu, Xiaotian Ye Published: 2025-06-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models Davide Venditti, Elena Sofia Ruzzetti, Fabio Massimo Zanzotto, Giancarlo A. Xompero Published: 2025-06-09Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-06-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 8 |
| Video Unlearning via Low-Rank Refusal Vector Alessio Sampieri, Andrea Pilzer, Edoardo De Matteis, Emanuele Rodol脿 Published: 2025-06-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (98%) | - |
| SoK: Machine Unlearning for Large Language Models Charu C. Aggarwal, Hui Liu, Jie Ren, Yingqian Cui Published: 2025-06-10Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-06-10 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R3 (96%) | 5 |
| SUA: Stealthy Multimodal Large Language Model Unlearning Attack Delvin Ce Zhang, Dongwon Lee, Hui Liu, Qi He Published: 2025-06-10Area: Model EditingCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-06-10 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 2 |
| Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods Ashwin Sreevatsa, Diogo Cruz, Shariqah Hossain, Yeonwoo Jang Published: 2025-06-11Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-06-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 3 |
| SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing Hongguang Zhu, Jiannan Huang, Mengyu Wang, Siyu Jiao Published: 2025-06-11Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-06-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models Boqing Gong, Yuwen Tan Published: 2025-06-12Area: Model EditingCitations: 1 Tags: ai-safety, model-editing, position | 2025-06-12 | Model Editing | ai-safety, model-editing, position | E4 / R3 (95%) | 1 |
| UCD: Unlearning in LLMs via Contrastive Decoding Ashia Wilson, Ayush Sekhari, Vinith M. Suriyakumar Published: 2025-06-12Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-06-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 5 |
| OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics Andrew McCallum, Anmol Mekala, J. Zico Kolter, Pratyush Maini Published: 2025-06-14Area: Model EditingCitations: 21 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-14 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (99%) | 21 |
| Robust LLM Unlearning with MUDMAN: Meta-Unlearning with Disruption Masking And Normalization Filip Sondej, Marcel Windys, Miko艂aj Kniejski, Yushi Yang Published: 2025-06-14Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-06-14 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 2 |
| Step-by-Step Reasoning Attack: Revealing 'Erased' Knowledge in Large Language Models Dinil Mon Divakaran, Manit Baser, Mohan Kankanhalli, Murari Mandal Published: 2025-06-14Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-06-14 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (94%) | 4 |
| Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skills Changsheng Wang, Chongyu Fan, Dennis Wei, Jinghan Jia Published: 2025-06-15Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-06-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 8 |
| Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs Qing Qu, Sijia Liu, Soumyadeep Pal, Yimeng Zhang Published: 2025-06-16Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-06-16 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | 4 |
| Learning-Time Encoding Shapes Unlearning in LLMs Kamalika Chaudhuri, Konstantin Garov, Ruihan Wu Published: 2025-06-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Mr. Snuffleupagus at SemEval-2025 Task 4: Unlearning Factual Knowledge from LLMs Using Adaptive RMU Arjun Dosajh, Mihika Sanghi Published: 2025-06-19Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | - |
| Reviving Your MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model Diffing Aly M. Kassem, Golnoosh Farnadi, Negar Rostamzadeh, Zhuan Shi Published: 2025-06-19Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-06-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 3 |
| Large Language Model Unlearning for Source Code Binhua Li, Ge Li, Rongyu Cao, Tangxinyu Wang Published: 2025-06-20Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm Ali Payani, Baixiang Huang, Dawei Li, Haoran Wang Published: 2025-06-25Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-06-25 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (95%) | - |
| Revisiting the Past: Data Unlearning with Model State History Abhilasha Ravichander, Keivan Rezaei, Mehrdad Saberi, Soheil Feizi Published: 2025-06-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-06-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (97%) | - |
| Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning Charles Fleming, Mahavir Dabas, Ming Jin, Ruoxi Jia Published: 2025-07-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-07-06 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 4 |
| Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann, Yan Scholten Published: 2025-07-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 2 |
| Internal Value Alignment in Large Language Models through Controlled Value Vector Activation Defu Lian, Haoran Jin, Meng Li, Minlie Huang Published: 2025-07-15Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | 3 |
| Scaling laws for activation steering with Llama 2 models and refusal mechanisms Ayse Arslan, Clark Benham, Ivory Yang, Jasmine Xinze Li Published: 2025-07-15Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 1 |