Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 451-467 of 467 papers (page 16 of 16)路 125 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| GSS: Gated Subspace Steering for Selective Memorization Mitigation in LLMs Haoyang Shang, Xiaoxiao Li, Xuanqi Zhang Published: 2026-02-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions Edward Grefenstette, Jakob Foerster, J Rosser, Laura Ruis Published: 2026-02-10Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-10 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| Gauss-Newton Unlearning for the LLM Era Anvith Thudi, Juhan Bae, Lev McKinney, Nicolas Papernot Published: 2026-02-11Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 2 |
| On the Robustness of Knowledge Editing for Detoxification Guanyi Chen, Ming Dong, Shiyi Tang, Tingting He Published: 2026-02-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| A Simple Yet Effective Method for Non-Refusing Context Relevant Fine-grained Safety Steering in LLMs Amrita Bhattacharjee, Christopher Parisien, Shaona Ghosh, Yftah Ziser Published: -Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 2 |
| EMMU: Efficient Information-Level Multimodal Machine Unlearning with High Model Fidelity Jiahui Hou, Jie Zhang, Tie Xiao, Xiang-Yang Li Published: -Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| GAIA-UL: Surgical Unlearning of Visual Knowledge via Causally-Guided Orthogonalization Jinghan Xu, Kaixuan Zhang, Qixuan Cai, Wenyu Qu Published: -Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Lock on Target! Precision Unlearning via Directional Control Feng Guo, Ran Le, Ruixiang Feng, Shen Gao Published: -Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 1 |
| Machine Unlearning Across Scales: Evaluation of Optimization Methods on Language Models Amartya Hatua, Trung T. Nguyen Published: -Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | - | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (95%) | - |
| Mitigating Privacy Seesaw in Large Language Models: Augmented Privacy Neuron Editing via Activation Patching Deyi Xiong, Shaoyang Xu, Weilong Dong, Xinwei Wu Published: -Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 12 |
| Nexus scissor: enhance open-access language model safety by connection pruning Peihua Mai, Ran Yan, Yan Pang, Youjia Yang Published: -Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | - | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Robustness of Edited Neural Networks Charles Godfrey, Cody Nizinski, Davis Brown, Henry Kvinge Published: -Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 8 |
| Selective LLM Unlearning via SAE-Based Token Importance Score Dong Woo Lee, In Jae Kim, Ji Young Shin, Jung Hun Lim Published: -Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | - |
| Towards a Unified Paradigm of Concept Editing in Large Language Models Dan Shi, Deyi Xiong, Renren Jin, Xinwei Wu Published: -Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | - |
| Towards Safe Concept Transfer of Multi-Modal Diffusion via Causal Representation Editing Bingjie Wang, Jie Zhang, Junxiao Wang, Peiran Dong Published: -Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | - | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 3 |
| Unlearning in Large Language Models: We Are Not There Yet Alberto Blanco-Justicia, Benet Manzanares-Salor, David S谩nchez, Josep Domingo-Ferrer Published: -Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, survey | - | Model Editing | ai-safety, model-editing, survey | E3 / R1 (97%) | 2 |