Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation Richard J. Young Published: 2025-12-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-15 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 2 |
| Robust MLLM Unlearning via Visual Knowledge Distillation Gang Hua, Guangyu He, Haichang Gao, Haoxuan Ji Published: 2025-12-12Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| Depth-Wise Activation Steering for Honest Language Models Gracjan G贸ral, Marysia Winkels, Steven Basart Published: 2025-12-08Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 1 |
| LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples Hanning Chen, Mohsen Imani, Wenjun Huang, Yang Ni Published: 2025-12-08Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 3 |
| Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning Hanning Chen, Mohsen Imani, Wenjun Huang, Yang Ni Published: 2025-12-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 2 |
| ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models Animesh Mukherjee, Mykola Pechenizkiy, Rima Hazra, Sayan Layek Published: 2025-12-06Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-12-06 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs Alex Cloud, Aryo Pradipta Gema, Cem Anil, Erik Jones Published: 2025-12-05Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-12-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| Grokked Models are Better Unlearners Yang Li, Yuanbang Liang Published: 2025-12-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | - |
| Representation Interventions Enable Lifelong Unstructured Knowledge Control Haifeng Chen, Haoyu Wang, Shengyu Chen, Xinshuai Dong Published: 2025-11-25Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (94%) | - |
| Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning Cees G. M. Snoek, Feng Li, Leijiang Gu, Meng Wang Published: 2025-11-25Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-25 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 1 |
| Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation Arani Roy, Kaushik Roy, Shristi Das Biswas Published: 2025-11-24Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 1 |
| Geometric-disentanglement Unlearning Cheng Qian, Chengxiang Zhai, Duo Zhou, Hanghang Tong Published: 2025-11-21Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 1 |
| GrOCE: Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models Chengqing Li, Feng Han, Jingjing Chen, Ning Han Published: 2025-11-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | - |
| Forgetting-MarI: LLM Unlearning via Marginal Information Regularization Shizhou Xu, Stefan Broecker, Thomas Strohmer, Yuan Ni Published: 2025-11-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion Feng Guo, Junshuo Zhang, Shen Gao, Shuo Shang Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective Cheng Zhang, Chongyu Fan, Jinsu Yoo, Justin Lee Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | - |
| Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models Alex Gittens, Ching-Yun Ko, Huzaifa Arif, Keerthiram Murugesan Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | - |
| SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought Ashwinee Panda, Kevin Zhu, Maheep Chaudhary, Pierce Tillman Published: 2025-11-11Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 3 |
| Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits Ashwinee Panda, Dev Patel, Diekola Raimi, Gabriel Grand Published: 2025-11-09Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-11-09 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (97%) | 1 |
| DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning Chris Yuhao Liu, Jinlong Pang, Quan Liu, Wei Wei Published: 2025-11-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-11-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| Leak@k: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding Hadi Reisizadeh, Jiajun Ruan, Mingyi Hong, Sijia Liu Published: 2025-11-07Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 1 |
| Steering Language Models with Weight Arithmetic Constanza Fierro, Fabien Roger Published: 2025-11-07Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-11-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| REMIND: Input Loss Landscapes Reveal Residual Memorization in Post-Unlearning LLMs Avi Mendelson, Liran Cohen, Yaniv Nemcovesky Published: 2025-11-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Angular Steering: Behavior Control via Rotation in Activation Space Hieu M. Vu, Tan M. Nguyen Published: 2025-10-30Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-10-30 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 7 |
| The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework Aakriti Shah, Thai Le Published: 2025-10-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| Probing Knowledge Holes in Unlearned LLMs Charles Fleming, Hoang Anh Just, Ming Jin, Myeongseob Ko Published: 2025-10-27Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-27 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (94%) | - |
| Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts Samaksh Bhargav, Zining Zhu Published: 2025-10-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models Chengyu Liu, Jingwen Ye, Lexiang Xiong, Yan Liu Published: 2025-10-26Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-10-26 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs Chenxue Yang, Jinzhe Liu, Junshu Sun, Shufan Shen Published: 2025-10-25Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 2 |
| Label Smoothing Improves Gradient Ascent in LLM Unlearning Hao Zheng, Jiaheng Wei, Ling Li, Zhijie Deng Published: 2025-10-25Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-25 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 2 |