Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ReLearn: Unlearning via Learning for Large Language Models Bryan Hooi, Haoming Xu, Huajun Chen, Liming Yang Published: 2025-02-16Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | 14 |
| Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment Animesh Mukherjee, Pratyush Chatterjee, Rima Hazra, Sayan Layek Published: 2025-02-16Area: Model EditingCitations: 5 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-16 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 5 |
| The Mirage of Model Editing: Revisiting Evaluation in the Wild Dawei Yin, Fei Sun, Huawei Shen, Jiajun Tan Published: 2025-02-16Area: Model EditingCitations: 16 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-16 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (94%) | 16 |
| LUNAR: LLM Unlearning via Neural Activation Redirection Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane Published: 2025-02-11Area: Model EditingCitations: 17 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-02-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (97%) | 17 |
| Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models Annalisa Riccardi, Paul Darm Published: 2025-02-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-02-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| TokenSwap: A Lightweight Method to Disrupt Memorized Sequences in LLMs Babak Salimi, Kaustubh Ponkshe, Parjanya Prajakta Prashant Published: 2025-02-07Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-02-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | - |
| Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond Anil Ramakrishna, Chongyu Fan, Jinghan Jia, Mingyi Hong Published: 2025-02-07Area: Model EditingCitations: 43 Tags: ai-safety, empirical, model-editing | 2025-02-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 43 |
| FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model Guangliang Cheng, Jinwei Hu, Wenjie Ruan, Xiangyu Yin Published: 2025-02-03Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-02-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 1 |
| SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals Cheng Qian, Denghui Zhang, Heng Ji, Peixuan Han Published: 2025-02-03Area: Model EditingCitations: 13 Tags: ai-safety, empirical, model-editing | 2025-02-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 13 |
| Tool Unlearning for Tool-Augmented LLMs Hadi Amiri, Jiali Cheng Published: 2025-02-03Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2025-02-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 10 |
| ALU: Agentic LLM Unlearning Debdeep Sanyal, Murari Mandal Published: 2025-02-01Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2025-02-01 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (97%) | 8 |
| Fantastic Targets for Concept Erasure in Diffusion Models and Where To Find Them Anh Bui, Dinh Phung, Junae Kim, Long Vuong Published: 2025-01-31Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2025-01-31 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 20 |
| Improving LLM Unlearning Robustness via Random Perturbations Dang Huu-Tien, Hoang Thanh-Tung, Le-Minh Nguyen, Naoya Inoue Published: 2025-01-31Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-01-31 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 4 |
| PSA: Differentially Private Steering for Large Language Model Alignment Amartya Sanyal, Anmol Goel, Iryna Gurevych, Yaxi Hu Published: 2025-01-30Area: Model EditingCitations: 9 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-01-30 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 9 |
| Distributional Surgery for Language Model Activations Bao Nguyen, Binh Nguyen, Duy Nguyen, Viet Anh Nguyen Published: 2025-01-27Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-01-27 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 3 |
| Interpretable Steering of Large Language Models with Feature Guided Activation Additions C. Balaganesh, Samuel Soo, Wesley Teng Published: 2025-01-17Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2025-01-17 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | 23 |
| NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning Gerard de Melo, Liang He, Linlin Wang, Shunfan Zheng Published: 2024-12-17Area: Model EditingCitations: 30 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-12-17 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (94%) | 30 |
| Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning Bo Li, Eleonora Krea膷i膰, Eli Chien, Mohsen Ghassemi Published: 2024-12-11Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-12-11 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 4 |
| Identifying and Manipulating Personality Traits in LLMs Through Activation Engineering James K. Wiles, Rumi A. Allbert Published: 2024-12-10Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-12-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research Abigail Z. Jacobs, A. Feder Cooper, Alexandra Chouldechova, Amy B. Cyphert Published: 2024-12-09Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, position | 2024-12-09 | Model Editing | ai-safety, model-editing, position | E5 / R3 (94%) | 2 |
| Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement Matters Kuien Liu, Ouxiang Li, Tingting Mu, Xiangnan He Published: 2024-12-09Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-12-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| UOE: Unlearning one Expert is Enough for Mixture-of-Experts LLMs Gaowen Liu, Haomin Zhuang, Jinghan Jia, Kehan Guo Published: 2024-11-27Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2024-11-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 10 |
| Steering Language Model Refusal with Sparse Autoencoders David Majercak, Dean Carignan, Eric Horvitz, Forough Poursabzi-Sangdeh Published: 2024-11-18Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-11-18 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 49 |
| Unlearning in- vs. out-of-distribution data in LLMs under gradient-based method Daniel Tarlow, Fabian Pedregosa, Gintare Karolina Dziugaite, Pascal Lamblin Published: 2024-11-07Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-11-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 4 |
| Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset Bo Li, Chaowei Xiao, Fei Wang, Furong Huang Published: 2024-11-05Area: Model EditingCitations: 14 Tags: ai-safety, alignment-training, benchmark, model-editing | 2024-11-05 | Model Editing | ai-safety, alignment-training, benchmark, model-editing | E6 / R3 (97%) | 14 |
| Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control Binbin Lin, Chaoqun Wan, Jieping Ye, Wenxiao Wang Published: 2024-11-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-11-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 5 |
| Extracting Unlearned Information from LLMs with Activation Steering Aleksei Kuvshinov, Atakan Seyito臒lu, Leo Schwinn, Stephan G眉nnemann Published: 2024-11-04Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-11-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 14 |
| RESTOR: Knowledge Recovery through Machine Unlearning Abhilasha Ravichander, Faeze Brahman, Keivan Rezaei, Khyathi Chandu Published: 2024-10-31Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-10-31 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E6 / R3 (95%) | 2 |
| Controlling Language and Diffusion Models by Transporting Activations Arno Blaas, Luca Zappella, Marco Cuturi, Michal Klein Published: 2024-10-30Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-10-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 24 |
| Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench Guangyao Dou, Meng Jiang, Mengzhao Jia, Qingkai Zeng Published: 2024-10-29Area: Model EditingCitations: 38 Tags: ai-safety, benchmark, model-editing | 2024-10-29 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 38 |