Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 467 papers (page 1 of 16)路 430 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Gauss-Newton Unlearning for the LLM Era Anvith Thudi, Juhan Bae, Lev McKinney, Nicolas Papernot Published: 2026-02-11Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 2 |
| On the Robustness of Knowledge Editing for Detoxification Guanyi Chen, Ming Dong, Shiyi Tang, Tingting He Published: 2026-02-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions Edward Grefenstette, Jakob Foerster, J Rosser, Laura Ruis Published: 2026-02-10Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-10 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| GSS: Gated Subspace Steering for Selective Memorization Mitigation in LLMs Haoyang Shang, Xiaoxiao Li, Xuanqi Zhang Published: 2026-02-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Controllable Value Alignment in Large Language Models through Neuron-Level Editing Fengbin Zhu, Jilong Liu, Junwei Li, Le Wu Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| Reverse-Engineering Model Editing on Language Models Minrui Luo, Tianxing He, Yu Wang, Zhili Chen Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention A. V. Subramanyam, Himanshu Singh, Mohan Kankanhalli, Ziwei Xu Published: 2026-02-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| Endogenous Resistance to Activation Steering in Language Models Alex McKenzie, Diogo de Lucena, Judd Rosenblatt, Keenan Pepper Published: 2026-02-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Is Gradient Ascent Really Necessary? Memorize to Forget for Machine Unlearning Bo Han, Qizhou Wang, Shanshan Ye, Tongliang Liu Published: 2026-02-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 4 |
| Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering Lyle Ungar, Miranda Muqing Miao, Young-Min Cho Published: 2026-02-05Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| C-螖螛: Circuit-Restricted Weight Arithmetic for Selective Refusal Aditya Kasliwal, Pratinav Seth, Vinay Kumar Sankarapu Published: 2026-02-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Fine-Grained Activation Steering: Steering Less, Achieving More Gee Wah Ng, Hanzhang Zhou, Jia Jim Deryl Chua, Junlang Qian Published: 2026-02-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| Inference-time Unlearning Using Conformal Prediction Amr Ahmed, Aranyak Mehta, Avinava Dubey, David Wang Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures Albert No, Hyesoo Hong, Sangyeon Yoon, Wonje Jeung Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | - |
| UnHype: CLIP-Guided Hypernetworks for Dynamic LoRA Unlearning Maciej Zieba, Maksym Petrenko, Piotr W贸jcik, Przemys艂aw Spurek Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (98%) | - |
| AGT-AO: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality Bifan Wei, Huan Liu, Jun Liu, Lingling Zhang Published: 2026-02-02Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (96%) | - |
| CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment Junyuan Hong, Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R4 (93%) | - |
| EvoMU: Evolutionary Machine Unlearning Paul Swoboda, Pawel Batorski Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (98%) | - |
| Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models Jiaqian Li, Kuan-Hao Huang, Yanshu Li Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics Chenyan Wu, Haiwen Hong, Hengyu Sun, Huajun Chen Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, model-editing, theoretical | 2026-02-02 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (95%) | - |
| BLOCK-EM: Preventing Emergent Misalignment by Blocking Causal Features Guannan Qu, Muhammed Ustaomeroglu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R2 (95%) | - |
| Sparsity-Aware Unlearning for Large Language Models Chuang Hu, Jiawei Jiang, Jingling Yuan, Ke Xu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | - |
| Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data Dan Alistarh, Eugenia Iofinova Published: 2026-01-30Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2026-01-30 | Model Editing | ai-safety, benchmark, model-editing | E5 / R4 (96%) | - |
| No More, No Less: Least-Privilege Language Models Dominykas Seputis, Mihaela van der Schaar, Patrikas Vanagas, Paulius Rauba Published: 2026-01-30Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-30 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities Dinh Mai Phuong, Hoang Thanh-Tung, Le-Minh Nguyen, Naoya Inoue Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | - |
| DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | - |
| FIT: Defying Catastrophic Forgetting in Continual LLM Unlearning Cheng Hong, Haibo Hu, Kun Fang, Minxin Du Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | - |
| From Logits to Latents: Contrastive Representation Shaping for LLM Unlearning Haoran Tang, Rajiv Khanna Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Knowledge Vector Weakening: Efficient Training-free Unlearning for Large Vision-Language Models Dongjun Hwang, Junsuk Choe, Sungmin Cha, Yejin Kim Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |