Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| What Should LLMs Forget? Quantifying Personal Data in LLMs for Right-to-Be-Forgotten Requests Dimitri Staufer Published: 2025-07-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| Minimalist Concept Erasure in Generative Models Ashkan Khakzar, Er Jin, Johannes Stegmaier, Kenji Kawaguchi Published: 2025-07-16Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-07-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 5 |
| Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning Adam Karvonen, Caden Juang, Helena Casademunt, Neel Nanda Published: 2025-07-22Area: Model EditingCitations: 13 Tags: ai-safety, alignment-training, empirical, interpretability, model-editing | 2025-07-22 | Model Editing | ai-safety, alignment-training, empirical, interpretability, model-editing | E6 / R3 (93%) | 13 |
| Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning Boheng Li, Junjie Wang, Leyi Qi, Renjie Gu Published: 2025-07-22Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-07-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 6 |
| GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs Archiki Prasad, Duy Nguyen, Elias Stengel-Eskin, Mohit Bansal Published: 2025-07-24Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 2 |
| Towards Evaluation for Real-World LLM Unlearning Ke Miao, Kui Ren, Wenjie Bao, Xiaochen Li Published: 2025-08-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-08-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E4 / R3 (95%) | - |
| LLM Unlearning using Gradient Ratio-Based Influence Estimation and Noise Injection Ameya Anjarlekar, Sandeep Pombra Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (96%) | 1 |
| LLM Unlearning Without an Expert Curated Dataset Muru Zhang, Ollie Liu, Robin Jia, Willie Neiswanger Published: 2025-08-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | 2 |
| Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining Bing Han, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 1 |
| MASteer: Multi-Agent Adaptive Steer Strategy for End-to-End LLM Trustworthiness Repair Aishan Liu, Changqing Li, Li Pan, Tianlin Li Published: 2025-08-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (99%) | - |
| NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs Birong Pan, Jianhao Chen, Mayi Xu, Ming Zhong Published: 2025-08-13Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 1 |
| CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features Adriano Koshiyama, Seonglae Cho, Zekun Wu Published: 2025-08-18Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-08-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 1 |
| CRISP: Persistent Concept Unlearning via Sparse Autoencoders Aaron Mueller, Dana Arad, Martin Tutek, Tomer Ashuach Published: 2025-08-19Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-08-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (97%) | 2 |
| Side Effects of Erasing Concepts from Diffusion Models Manas Gaur, Shaswati Saha, Sourajit Saha, Tejas Gokhale Published: 2025-08-20Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing | 2025-08-20 | Model Editing | ai-safety, benchmark, model-editing | E9 / R3 (94%) | 2 |
| Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection Chengcan Wu, Huanran Chen, Meng Sun, Yinpeng Dong Published: 2025-08-21Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-08-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks Jianbing Ni, Qi Li, Rongxing Lu, Xiangman Li Published: 2025-08-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-08-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Module-Aware Parameter-Efficient Machine Unlearning on Transformers Jian Lou, Jiaqi Liu, Kui Ren, Wenjie Bao Published: 2025-08-24Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs Haotian Yu, Pan Li, Runchao Li, Xianxuan Long Published: 2025-08-27Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-08-27 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 4 |
| Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint Bo Li, Jian Lou, Kui Ren, Wenjie Bao Published: 2025-08-28Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (97%) | - |
| Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection Bernard Ghanem, George Turkiyyah, Harethah Abu Shairah, Hasan Abed Al Kader Hammoud Published: 2025-08-28Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 3 |
| Improving Fisher Information Estimation and Efficiency for LoRA-based LLM Unlearning Buru Chang, Eunwon Kim, Junsuk Choe, Yejin Kim Published: 2025-08-29Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-08-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (98%) | 3 |
| Standard vs. Modular Sampling: Best Practices for Reliable LLM Unlearning Lucia Passaro, Praveen Bushipaka, Tommaso Cucinotta Published: 2025-08-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | - |
| Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs Francesco Croce, Matthias Hein, Maximilian M眉ller, Naman Deep Singh Published: 2025-09-02Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-09-02 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 4 |
| Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions Faruk Alpay Lightcap, Taylan Alpay Published: 2025-09-04Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 1 |
| MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors Bo Jin, Jingya Wang, Meng Han, Xin Tong Published: 2025-09-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Steering MoE LLMs via Expert (De)Activation Ali Modarressi, Franck Dernoncourt, Hanieh Deilamsalehy, Hinrich Sch眉tze Published: 2025-09-11Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-09-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 7 |
| Collapse of Irrelevant Representations (CIR) Ensures Robust and Non-Disruptive LLM Unlearning Filip Sondej, Yushi Yang Published: 2025-09-15Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Scrub It Out! Erasing Sensitive Memorization in Code Language Models via Machine Unlearning David Lo, Di Wang, Hai Jin, Hongyu Zhang Published: 2025-09-17Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-09-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| Reveal and Release: Iterative LLM Unlearning with Self-generated Data Hongyi Wen, Linxi Xie, Shengjie Wang, Shichang Ke Published: 2025-09-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets Masanori Yamada, Takayuki Miura, Tomoharu Iwata, Tomoya Yamashita Published: 2025-09-19Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 1 |