Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| UniErase: Towards Balanced and Precise Unlearning in Language Models Guibin Zhang, Ivor Tsang, Junfeng Fang, Kun Wang Published: 2025-05-21Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-05-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 2 |
| Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders Agam Goyal, Hari Sundaram, Vedant Rathi, William Yeh Published: 2025-05-20Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-05-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| SEPS: A Separability Measure for Robust Unlearning in LLMs Albert No, Sangyeon Yoon, Wonje Jeung Published: 2025-05-20Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-05-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection Chris Yuhao Liu, Jiaheng Wei, Lei Feng, Qi Xuan Published: 2025-05-19Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-05-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 8 |
| Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering Houqiang Li, Jiale Hong, Jianfeng Cai, Nianji Zhan Published: 2025-05-19Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-05-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 3 |
| Revealing the Deceptiveness of Knowledge Editing: A Mechanistic Analysis of Superficial Editing Jiakuan Xie, Jun Zhao, Kang Liu, Pengfei Cao Published: 2025-05-19Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-05-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| Exploring Criteria of Loss Reweighting to Enhance LLM Unlearning Bo Han, Chengqi Zhang, Puning Yang, Qizhou Wang Published: 2025-05-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2025-05-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 25 |
| Ready2Unlearn: A Learning-Time Approach for Preparing Models with Future Unlearning Readiness Ahmed Abbasi, Hanyu Duan, Kar Yan Tam, Yi Yang Published: 2025-05-16Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-05-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Interpretable Risk Mitigation in LLM Agent Systems Jan Chojnacki Published: 2025-05-15Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-05-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 4 |
| Layered Unlearning for Adversarial Relearning Ashia Wilson, Dylan Hadfield-Menell, Timothy Qian, Vinith Suriyakumar Published: 2025-05-14Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-14 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Unilogit: Robust Machine Unlearning for LLMs Using Uniform-Target Self-Distillation Baohao Liao, Christian Herold, Christof Monz, Seyyed Hadi Hashemi Published: 2025-05-09Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-05-09 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (94%) | 2 |
| WaterDrum: Watermarking for Data-centric Unlearning Metric Bryan Kian Hsiang Low, Bui Thi Cam Nhung, Chuan-Sheng Foo, Fanyu Wen Published: 2025-05-08Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-05-08 | Model Editing | ai-safety, benchmark, model-editing | E4 / R3 (96%) | - |
| OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models Haibo Hu, Minxin Du, Qingqing Ye, Xiaoyu Xu Published: 2025-05-07Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-05-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | 6 |
| Patterns and Mechanisms of Contrastive Activation Engineering Ayush Panda, Sheikh Abdur Raheem Ali, Stepan Shabalin, Yixiong Hao Published: 2025-05-06Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-06 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Dialz: A Python Toolkit for Steering Vectors Liam D. Turner, Luis Espinosa-Anke, Zara Siddique Published: 2025-05-04Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, tool | 2025-05-04 | Model Editing | ai-safety, model-editing, tool | E5 / R4 (96%) | 2 |
| Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation Jie Peng, Mohit Bansal, Peter Hase, Tianlong Chen Published: 2025-05-01Area: Model EditingCitations: 8 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-05-01 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 8 |
| DualOptim: Enhancing Efficacy and Stability in Machine Unlearning with Dual Optimizers Chen Liu, Haochen Luo, Xuyang Zhong Published: 2025-04-22Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-04-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models Guozhou Zheng, Haoming Xu, Huajun Chen, Kewei Xu Published: 2025-04-21Area: Model EditingCitations: 7 Tags: ai-safety, model-editing, tool | 2025-04-21 | Model Editing | ai-safety, model-editing, tool | E6 / R5 (96%) | 7 |
| A mean teacher algorithm for unlearning of language models Yegor Klochkov Published: 2025-04-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-04-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| DP2Unlearning: An Efficient and Guaranteed Unlearning Framework for LLMs David Sanchez, Josep Domingo-Ferrer, Najeeb Jebreel, Tamim Al Mahmud Published: 2025-04-18Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-04-18 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | 1 |
| GRAIL: Gradient-Based Adaptive Unlearning for Privacy and Copyright in LLMs Ji-Hoon Park, Ju-Min Han, Kun-Woo Kim, Seong-Whan Lee Published: 2025-04-17Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 3 |
| SHA256 at SemEval-2025 Task 4: Selective Amnesia - Constrained Unlearning for Large Language Models via Knowledge Isolation Kuan-Hao Huang, Saransh Agrawal Published: 2025-04-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks Bhavya Kailkhura, Changsheng Wang, James Diffenderfer, Sijia Liu Published: 2025-04-14Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-14 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R4 (95%) | 10 |
| SAEs Can Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs Aashiq Muhamed, Jacopo Bonato, Mona Diab, Virginia Smith Published: 2025-04-11Area: Model EditingCitations: 17 Tags: ai-safety, empirical, model-editing | 2025-04-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 17 |
| A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty Chaochao Chen, Chengye Wang, Junlin Liu, Li Zhang Published: 2025-04-09Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-04-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Not All Data Are Unlearned Equally Aravind Krishnan, Marius Mosbach, Siva Reddy Published: 2025-04-07Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-07 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (94%) | 8 |
| Exact Unlearning of Finetuning Data via Model Merging at Scale Aditi Raghunathan, Amrith Setlur, Kartik Srinivas, Kevin Kuo Published: 2025-04-06Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2025-04-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 14 |
| Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability Mohammad Mahdi Khalili, Vishnu Kabir Chhabra Published: 2025-04-05Area: Model EditingCitations: - Tags: ai-safety, empirical, interpretability, model-editing | 2025-04-05 | Model Editing | ai-safety, empirical, interpretability, model-editing | E7 / R3 (98%) | - |
| Effectively Controlling Reasoning Models through Thinking Intervention Chong Xiang, Jiachen T. Wang, Prateek Mittal, Tong Wu Published: 2025-03-31Area: Model EditingCitations: 52 Tags: ai-safety, empirical, model-editing | 2025-03-31 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 52 |
| SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning Feijie Wu, Jing Gao, Tianyang Xu, Xiaoqian Wang Published: 2025-03-29Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-03-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 5 |