Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models Annalisa Riccardi, Paul Darm Published: 2025-02-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-02-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| LUNAR: LLM Unlearning via Neural Activation Redirection Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-02-11Area: Model EditingCitations: 17 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-02-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (97%) | 17 |
| MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models Jiahao Huo, Xin Zou, Xuming Hu, Xu Zheng Published: 2025-02-16Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 24 |
| ReLearn: Unlearning via Learning for Large Language Models Bryan Hooi, Haoming Xu, Huajun Chen, Liming Yang Published: 2025-02-16Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | 14 |
| Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment Animesh Mukherjee, Pratyush Chatterjee, Rima Hazra, Sayan Layek Published: 2025-02-16Area: Model EditingCitations: 5 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 5 |
| The Mirage of Model Editing: Revisiting Evaluation in the Wild Dawei Yin, Fei Sun, Huawei Shen, Jiajun Tan Published: 2025-02-16Area: Model EditingCitations: 16 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-16 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (94%) | 16 |
| DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing Fenghua Weng, Minlie Huang, Sibei Yang, Wenjie Wang Published: 2025-02-17Area: Model EditingCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-02-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 6 |
| Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning Hwan Chang, Hwanhee Lee Published: 2025-02-17Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-02-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 5 |
| Bridge the Gaps between Machine Unlearning and AI Regulation Bill Marino, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-02-18Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, position | 2025-02-18 | Model Editing | ai-safety, model-editing, position | E5 / R3 (95%) | 5 |
| Multi-Attribute Steering of Language Models via Targeted Intervention Archiki Prasad, Duy Nguyen, Elias Stengel-Eskin, Mohit Bansal Published: 2025-02-18Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2025-02-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 20 |
| Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosis Haomin Zhuang, Kehan Guo, Tianyu Yang, Xiangliang Zhang Published: 2025-02-19Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2025-02-19 | Model Editing | ai-safety, benchmark, model-editing | E6 / R4 (96%) | 3 |
| LUME: LLM Unlearning with Multitask Evaluations Anil Ramakrishna, Bhanukiran Vinzamuri, Kai-Wei Chang, Mingyi Hong Published: 2025-02-20Area: Model EditingCitations: 25 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-20 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 25 |
| Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models Ahmed Salem, Mark Russinovich Published: 2025-02-20Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-02-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 4 |
| Revealing and Mitigating Over-Attention in Knowledge Editing Juntao Li, Keyan Zhou, Min Zhang, Pinzheng Wang Published: 2025-02-20Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-02-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 4 |
| UPCORE: Utility-Preserving Coreset Selection for Balanced Unlearning Elias Stengel-Eskin, Mohit Bansal, Vaidehi Patil Published: 2025-02-20Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-02-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 6 |
| Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models Chunhui Zhang, Guangyao Dou, Meng Jiang, Xiangchi Yuan Published: 2025-02-21Area: Model EditingCitations: 13 Tags: ai-safety, empirical, model-editing | 2025-02-21 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (94%) | 13 |
| A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models Fakhri Karray, Hans-Arno Jacobsen, Herbert Woisetschl盲ger, Jiahui Geng Published: 2025-02-22Area: Model EditingCitations: 23 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-02-22 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R4 (97%) | 23 |
| LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint Dongrui Liu, Jing Shao, Linfeng Zhang, Qian Chen Published: 2025-02-24Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-02-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 6 |
| Proactive Privacy Amnesia for Large Language Models: Safeguarding PII with Negligible Impact on Model Utility Amin Hass, Aolin Ding, Hai Li, Jianyi Zhang Published: 2025-02-24Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2025-02-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 9 |
| A General Framework to Enhance Fine-tuning-based LLM Unlearning Hui Liu, Jie Ren, Jingying Zeng, Qi He Published: 2025-02-25Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-02-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 8 |
| FaithUn: Toward Faithful Forgetting in Language Models by Investigating the Interconnectedness of Knowledge Joongbo Shin, Kyomin Jung, Minsung Kim, Nakyeong Yang Published: 2025-02-26Area: Model EditingCitations: 6 Tags: ai-safety, benchmark, model-editing | 2025-02-26 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 6 |
| Rethinking LLM Unlearning Objectives: A Gradient Perspective and Go Beyond Bo Han, Jin Peng Zhou, Kilian Q. Weinberger, Qizhou Wang Published: 2025-02-26Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2025-02-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 37 |
| Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models Dacheng Tao, Haifeng Sun, Huazheng Wang, Jianxin Liao Published: 2025-02-27Area: Model EditingCitations: 1 Tags: ai-safety, benchmark, model-editing | 2025-02-27 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (97%) | 1 |
| UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targets Mengqi Zhang, Pengjie Ren, Wenyu Wang, Xiaotian Ye Published: 2025-03-06Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-03-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 6 |
| Mitigating Memorization in LLMs using Activation Steering Amisha Bhaskar, Manan Suri, Nishit Anand Published: 2025-03-08Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-03-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 8 |
| SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models Fuli Feng, Guojun Ma, Houcheng Jiang, Ouxiang Li Published: 2025-03-10Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2025-03-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 18 |
| ACE: Concept Editing in Diffusion Models without Performance Degradation Hao Chen, Jiaqi Li, Jie Shi, Junfeng Fang Published: 2025-03-11Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-03-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 4 |
| LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss Arno Blaas, Eleonora Gualdoni, Luca Zappella, Marco Cuturi Published: 2025-03-11Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-03-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| GRU: Mitigating the Trade-off between Unlearning and Retention for Large Language Models Bo Han, Feng Liu, Qizhou Wang, Wei Huang Published: 2025-03-12Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2025-03-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 12 |
| Sparse Autoencoder as a Zero-Shot Classifier for Concept Erasing in Text-to-Image Diffusion Models Jiaheng Zhang, Jian Liu, Kui Ren, Ming Xu Published: 2025-03-12Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-03-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | 5 |