Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Per-parameter Task Arithmetic for Unlearning in Large Language Models Bo Han, Chengyi Cai, Feng Liu, Jiangchao Yao Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (96%) | - |
| Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning Bo Han, Chengyi Cai, Feng Liu, Jianzhong Qi Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Reinforcement Unlearning via Group Relative Policy Optimization Bardh Prenkaj, Efstratios Zaradoukas, Gjergji Kasneci Published: 2026-01-28Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-28 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection Chris Ngo, Quy-Anh Dang Published: 2026-01-27Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-27 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| A Few Bad Neurons: Isolating and Surgically Correcting Sycophancy Aditya Dwivedi, Ashwinee Panda, Claire O'Brien, Dristi Roy Published: 2026-01-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints Andy Zhu, Pan Li, Rongzhe Wei, Yupu Gu Published: 2026-01-23Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-23 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | - |
| Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits Been Kim, Drew Proud, Mani Malek, Neha Kalibhat Published: 2026-01-23Area: Model EditingCitations: - Tags: ai-safety, empirical, interpretability, model-editing | 2026-01-23 | Model Editing | ai-safety, empirical, interpretability, model-editing | E5 / R3 (91%) | - |
| Auditing Language Model Unlearning via Information Decomposition Alan Ritter, Anmol Goel, Iryna Gurevych Published: 2026-01-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection Alfan Farizki Wicaksono, Fajri Koto, Muhammad Alif Al Hakim Published: 2026-01-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models Andi Zhang, Guangxu Chen, Jingxin Han, Xiaojie Gu Published: 2026-01-16Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-16 | Model Editing | ai-safety, empirical, model-editing | E8 / R4 (96%) | - |
| Representation-Aware Unlearning via Activation Signatures: From Suppression to Knowledge-Signature Erasure Farig Sadeque, Jareen Tasneem Khondaker, K. M. Shadman Wadith, Md. Rezaur Rahman Bhuiyan Published: 2026-01-15Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 1 |
| BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning Fengbin Zhu, Lei Chen, Meng Wang, Naixin Zhai Published: 2026-01-14Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (99%) | 1 |
| STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models Gaoxiang Cong, Jingjing Zhou, Liang Li, Li Su Published: 2026-01-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| Toward Understanding Unlearning Difficulty: A Mechanistic Perspective and Circuit-Guided Difficulty Metric Chirag Agarwal, Hadi Amiri, Jiali Cheng, Ziheng Chen Published: 2026-01-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment Geng Yuan, Lingzi Hong, Ninghao Liu, Ningxi Cheng Published: 2026-01-13Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning Tony Cristofano Published: 2026-01-13Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 1 |
| Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs Aditi Khandelwal, Alireza Dehghanpour Farashah, Golnoosh Farnadi, Marylou Fauchard Published: 2026-01-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning Haibo Hu, Minxin Du, Peizhao Hu, Qingqing Ye Published: 2026-01-07Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-07 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs Ashok Urlana, Bala Mallikarjunarao Garlapati, Dinesh Srivasthav P, Ponnurangam Kumaraguru Published: 2026-01-07Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning Binbin Zheng, Fei Shen, Long Bai, Naixin Zhai Published: 2026-01-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2026-01-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance Jian Liu, Jian Lou, Jiawen Zhang, Kejia Chen Published: 2026-01-05Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-05 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (97%) | 1 |
| ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Patching Bin Chen, Hongyan Li, Junhao Li, Xinhao Zhong Published: 2026-01-01Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-01 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Investigating Model Editing for Unlearning in Large Language Models Lalana Kagal, Shariqah Hossain Published: 2025-12-23Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-12-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 4 |
| The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation Hengrui Jia, Jonas Guan, Taoran Li, Varun Chandrasekaran Published: 2025-12-22Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-22 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R4 (93%) | - |
| Consistency-Aware Editing for Entity-level Unlearning in Language Models Jeff Z. Pan, Jiye Liang, Ru Li, V铆ctor Guti茅rrez-Basulto Published: 2025-12-19Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | - |
| Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models Chenxu Zhao, Mengdi Huai, Wei Qian, Yangyi Li Published: 2025-12-19Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-12-19 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (97%) | - |
| Feature-Selective Representation Misdirection for Machine Unlearning Huaming Chen, Kim-Kwang Raymond Choo, Linghan Huang, Taozhao Chen Published: 2025-12-18Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-12-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics David Montero, Iker Garc铆a-Ferrero, Roman Orus Published: 2025-12-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| FAME: Fictional Actors for Multilingual Erasure Alkis Koudounas, Claudio Savelli, Flavio Giobergia, Moreno La Quatra Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-12-17 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (97%) | - |
| SALVE: Sparse Autoencoder-Latent Vector Editing for Mechanistic Control of Neural Networks Vegard Flovik Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-17 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | - |