Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models Akira Ito, Masanori Yamada, Takayuki Miura, Tomoya Yamashita Published: 2025-09-19Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 1 |
| SAEmnesia: Erasing Concepts in Diffusion Models with Supervised Sparse Autoencoders Alan Perotti, Enrico Cassano, Marco Grangetto, Marco Nurisso Published: 2025-09-23Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 1 |
| Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization Chongyang Gao, Kaize Ding, Ren Wang, Wenhan Wu Published: 2025-09-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-24 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing Aishan Liu, Dacheng Tao, Siyuan Liang, Xianglong Liu Published: 2025-09-24Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-09-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| A Unified Framework for Diffusion Model Unlearning with f-Divergence Andrea M. Tonello, Deniz G眉nd眉z, Federico Fontana, Luigi Cinque Published: 2025-09-25Area: Model EditingCitations: - Tags: ai-safety, model-editing, theoretical | 2025-09-25 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (96%) | - |
| CLUE: Conflict-guided Localization for LLM Unlearning Framework Hang Chen, Jiaying Zhu, Wenya Wang, Xinyu Yang Published: 2025-09-25Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-25 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (93%) | - |
| Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning Dong-Kyum Kim, Jea Kwon, Kyomin Jung, Meeyoung Cha Published: 2025-09-26Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models Agnieszka Polowczyk, Alicja Polowczyk, Joanna Waczy艅ska, Piotr Borycki Published: 2025-09-26Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 1 |
| OFMU: Optimization-Driven Framework for Machine Unlearning Mohammad Mohammadi Amiri, Sadia Asif Published: 2025-09-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | - |
| Dual-Space Smoothness for Robust and Balanced LLM Unlearning Han Yan, Meng Jiang, Zheyuan Liu Published: 2025-09-27Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R3 (93%) | 1 |
| Stable Forgetting: Bounded Parameter-Efficient Unlearning in LLMs Arpit Garg, Hemanth Saratchandran, Ravi Garg, Simon Lucey Published: 2025-09-29Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Understanding the Dilemma of Unlearning for Large Language Models Chao Zhang, Cheng Hong, Han Qiu, Haoting Qian Published: 2025-09-29Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-09-29 | Model Editing | ai-safety, empirical, model-editing | E8 / R3 (93%) | 3 |
| Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning Hong kyu Lee, Li Xiong, Ruixuan Liu Published: 2025-09-30Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions Dongha Lim, Jihoon Tack, Jinwoo Shin, Junbeom Kim Published: 2025-09-30Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning Changsheng Wang, Chongyu Fan, Jinghan Jia, Sijia Liu Published: 2025-10-01Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning Hao Chen, Jindong Wang, Kai Qiu, Marios Savvides Published: 2025-10-01Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (94%) | - |
| Activation Steering with a Feedback Controller Dung V. Nguyen, Hieu M. Vu, Lei Zhang, Nhi Y. Pham Published: 2025-10-05Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering Chenlu Ding, Fan Zhang, Jiancan Wu, Leheng Sheng Published: 2025-10-05Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-10-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 3 |
| Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning Bin Liang, Haoyuan Sun, Houde Liu, Jianxiang He Published: 2025-10-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 2 |
| Cross-Modal Attention Guided Unlearning in Vision-Language Models Aneesh Komanduri, Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | - |
| LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics Changsheng Wang, Chongyu Fan, Sijia Liu, Soumyadeep Pal Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | - |
| PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing Anthony Hughes, N. Asokan, Nikolaos Aletras, Ning Ma Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Energy-Driven Steering: Reducing False Refusals in Large Language Models Eric Hanchen Jiang, Guancheng Wan, Kai-Wei Chang, Ranjie Duan Published: 2025-10-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | - |
| SIMU: Selective Influence Machine Unlearning Anu Agarwal, Dilek Hakkani-Tur, Mihir Pamnani Published: 2025-10-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | - |
| LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data Changsheng Wang, Dennis Wei, Jinghan Jia, Pin-Yu Chen Published: 2025-10-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration Di Wang, Hongji Li, Lijie Hu, Manjiang Yu Published: 2025-10-11Area: Model EditingCitations: 7 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 7 |
| Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers Claudia Soares, Marta Guimaraes, Ruben Belo Published: 2025-10-14Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | - |
| Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check Dasol Hwang, Frederic Sala, Kyunghyun Cho, Sangheum Hwang Published: 2025-10-14Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 1 |
| In-Distribution Steering: Balancing Control and Coherence in Language Model Generation Annabelle Blangero, Arthur Vogels, Benjamin Wong, Milan Bhan Published: 2025-10-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models Anna Hedstr枚m, Manuela Veloso, Salim I. Amoukou, Saumitra Mishra Published: 2025-10-15Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-10-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 6 |