Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality Chenlong Zhang, Hongbang Yuan, Jiaheng Wei, Jun Zhao Published: 2025-06-08Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-06-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 5 |
| Distillation Robustifies Unlearning Addie Foote, Alexander Matt Turner, Alex Cloud, Alex Infanger Published: 2025-06-06Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 6 |
| Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness Eli Chien, Hans Hao-Hsun Hsu, Haoteng Yin, Kamalika Chaudhuri Published: 2025-06-06Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 9 |
| Towards Lifecycle Unlearning Commitment Management: Measuring Sample-level Unlearning Completeness Cheng-Long Wang, Di Wang, Qi Li, Yinzhi Cao Published: 2025-06-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-06-06 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 4 |
| HyperSteer: Activation Steering at Scale with Hypernetworks Atticus Geiger, Christopher Potts, Jiuding Sun, Michael Sklar Published: 2025-06-03Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-06-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 6 |
| Not All Tokens Are Meant to Be Forgotten Dongxiao Zhu, Douglas Zytko, Prashant Khanduri, Saleh Zare Zade Published: 2025-06-03Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-06-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | 2 |
| Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model Guoqing Jin, Mingjie Deng, Yan Song, Yuanhe Tian Published: 2025-06-02Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-06-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning Changsheng Wang, Dennis Wei, Jinghan Jia, Nathalie Baracaldo Published: 2025-06-02Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2025-06-02 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 12 |
| ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs Dinil Mon Divakaran, Manit Baser, Mohan Gurusamy Published: 2025-06-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (98%) | - |
| SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs Amrita Bhattacharjee, Christopher Parisien, Shaona Ghosh, Yftah Ziser Published: 2025-06-01Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-06-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 8 |
| Existing Large Language Model Unlearning Evaluations Are Inconclusive Alexander Robey, Avi Schwarzschild, J. Zico Kolter, Robert Kirk Published: 2025-05-31Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-05-31 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 7 |
| Keeping an Eye on LLM Unlearning: The Hidden Risk and Remedy Charu C. Aggarwal, Hui Liu, Jie Ren, Jingying Zeng Published: 2025-05-31Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-05-31 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 7 |
| Model Unlearning via Sparse Autoencoder Subspace Guided Projections Benyou Wang, Difan Zou, Xu Wang, Yan Hu Published: 2025-05-30Area: Model EditingCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-30 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 7 |
| Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM Terrance Liu, Xiaoyu Wu, Yifei Pang, Zhiwei Steven Wu Published: 2025-05-30Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-05-30 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (99%) | 3 |
| Does Machine Unlearning Truly Remove Knowledge? A Framework for Auditing Unlearning in LLMs Claudia Grosser, Denis Krompass, Haokun Chen, Jian Lan Published: 2025-05-29Area: Model EditingCitations: 6 Tags: ai-safety, benchmark, model-editing | 2025-05-29 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (95%) | 6 |
| Adaptive Detoxification: Safeguarding General Capabilities of LLMs through Toxicity-Aware Knowledge Editing Fangming Liu, Jing Li, Jun Yu, Meishan Zhang Published: 2025-05-28Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-05-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 5 |
| From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization Adrian Weller, David Krueger, Eleni Triantafillou, Gintare Karolina Dziugaite Published: 2025-05-28Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-05-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 4 |
| Precise In-Parameter Concept Erasure in Large Language Models Clara Suslik, Fazl Barez, Mor Geva, Yihuai Hong Published: 2025-05-28Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-05-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 7 |
| Tracing and Reversing Rank-One Model Edits Christin Seifert, J枚rg Schl枚tterer, Paul Youssef, Zhixue Zhao Published: 2025-05-27Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-05-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 2 |
| Editing as Unlearning: Are Knowledge Editing Methods Strong Baselines for Large Language Model Unlearning? Chao Wu, Dongqi Cai, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-05-26Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-05-26 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 8 |
| Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? Bo Han, Chaowei Xiao, Hongzheng Yang, Kun Zhang Published: 2025-05-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | - |
| Safety Alignment via Constrained Knowledge Unlearning Daojing He, Fangming Liu, Jing Li, Jun Yu Published: 2025-05-24Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2025-05-24 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 6 |
| Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target Atoms Huajun Chen, Mengru Wang, Ningyu Zhang, Shengyu Mao Published: 2025-05-23Area: Model EditingCitations: 16 Tags: ai-safety, empirical, model-editing | 2025-05-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 16 |
| Redirection for Erasing Memory (REM): Towards a universal unlearning method for corrupted data Alexandra Brintrup, Eleni Triantafillou, George Kaissis, Michael C. Mozer Published: 2025-05-23Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-05-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models Hwiyeong Lee, Hyelim Lim, Taeuk Kim, Uiji Hwang Published: 2025-05-22Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs Amr Alanwar, Amr Hegazy, Mostafa Elhoushi Published: 2025-05-22Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (96%) | 4 |
| Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting Bang Trinh Tran To, Thai Le Published: 2025-05-22Area: Model EditingCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (94%) | 4 |
| SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models Ali Payani, Bo Shen, Mengnan Du, Mingyu Jin Published: 2025-05-22Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 10 |
| Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs Haibo Hu, Minxin Du, Qingqing Ye, Xiang Yue Published: 2025-05-22Area: Model EditingCitations: 22 Tags: ai-safety, empirical, model-editing | 2025-05-22 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | 22 |
| DUSK: Do Not Unlearn Shared Knowledge Albert No, Hyesoo Hong, Sangyeon Yoon, Seungju Han Published: 2025-05-21Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2025-05-21 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 3 |