Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| MEOW: MEMOry Supervised LLM Unlearning Via Inverted Facts Kexin Huang, Ruilin Luo, Tianle Gu, Yan Teng Published: 2024-09-18Area: Model EditingCitations: 17 Tags: ai-safety, empirical, model-editing | 2024-09-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 17 |
| Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models Abhishek Lalwani, Anmol Mekala, David Koleczek, Elita Lobo Published: 2024-09-20Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-09-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 21 |
| "Why" Has the Least Side Effect on Model Editing Chung-Chi Chen, Hen-Hsen Huang, Hsin-Hsi Chen, Tsung-Hsuan Pan Published: 2024-09-27Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-09-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 1 |
| Identifying Knowledge Editing Types in Large Language Models Bin Ji, Huijun Liu, Jie Yu, Jun Ma Published: 2024-09-29Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2024-09-29 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 3 |
| Towards Inference-time Category-wise Safety Steering for Large Language Models Amrita Bhattacharjee, Christopher Parisien, Shaona Ghosh, Traian Rebedea Published: 2024-10-02Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-02 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 15 |
| AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models Houcheng Jiang, Jie Shi, Junfeng Fang, Kun Wang Published: 2024-10-03Area: Model EditingCitations: 157 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (97%) | 157 |
| Erasing Conceptual Knowledge from Language Models David Bau, Rohit Gandikota, Samuel Marks, Sheridan Feucht Published: 2024-10-03Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 24 |
| Mitigating Memorization In Language Models Arham Khan, Aswathy Ajith, Caleb Geniesse, Ian Foster Published: 2024-10-03Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 10 |
| A Probabilistic Perspective on Unlearning and Alignment for Large Language Models Leo Schwinn, Stephan G眉nnemann, Yan Scholten Published: 2024-10-04Area: Model EditingCitations: 18 Tags: ai-safety, alignment-training, empirical, model-editing, safety-evaluation | 2024-10-04 | Model Editing | ai-safety, alignment-training, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 18 |
| Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation Barbara Plank, Chengzhi Hu, Paul R枚ttger, Xinpeng Wang Published: 2024-10-04Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-10-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 26 |
| Neuron-Level Sequential Editing for Large Language Models An Zhang, Houcheng Jiang, Junfeng Fang, Ruipeng Wang Published: 2024-10-05Area: Model EditingCitations: 13 Tags: ai-safety, empirical, model-editing | 2024-10-05 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 13 |
| Activation Scaling for Steering and Interpreting Language Models Aaron Schein, Kevin Du, Niklas Stoehr, Robert West Published: 2024-10-07Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-10-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | 21 |
| Locate-then-edit for Multi-hop Factual Recall under Knowledge Editing Di Wang, Keyuan Cheng, Lijie Hu, Yongxiang Li Published: 2024-10-08Area: Model EditingCitations: 30 Tags: ai-safety, empirical, model-editing | 2024-10-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 30 |
| Dissecting Fine-Tuning Unlearning in Large Language Models Di Wang, Haiqin Yang, Lijie Hu, Yihuai Hong Published: 2024-10-09Area: Model EditingCitations: 17 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 17 |
| Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning Chongyu Fan, Jiancheng Liu, Jinghan Jia, Licong Lin Published: 2024-10-09Area: Model EditingCitations: 82 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 82 |
| Steering Large Language Models using Conceptors: Improving Addition-Based Activation Engineering Joris Postmus, Steven Abreu Published: 2024-10-09Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 15 |
| A Closer Look at Machine Unlearning for Large Language Models Chao Du, Kejiang Chen, Min Lin, Tianyu Pang Published: 2024-10-10Area: Model EditingCitations: 35 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-10-10 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 35 |
| Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models Ashia C. Wilson, Ayush Sekhari, Manish Raghavan, Rohan Alur Published: 2024-10-10Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-10-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger Published: 2024-10-11Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-10-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 49 |
| Keys to Robust Edits: from Theoretical Insights to Practical Advances Futing Wang, Jianhao Yan, Yafu Li, Yue Zhang Published: 2024-10-12Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-10-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| LLM Unlearning via Loss Adjustment with Only Forget Data Ankit Parag Shah, Chris Yuhao Liu, Jiaheng Wei, Jinlong Pang Published: 2024-10-14Area: Model EditingCitations: 55 Tags: ai-safety, empirical, model-editing | 2024-10-14 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 55 |
| Locking Down the Finetuned LLMs Safety Linyi Yang, Minjun Zhu, Ningyu Zhang, Yifan Wei Published: 2024-10-14Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-10-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 23 |
| Improving Instruction-Following in Language Models through Activation Steering Alessandro Stolfo, Besmira Nushi, Eric Horvitz, Safoora Yousefi Published: 2024-10-15Area: Model EditingCitations: 86 Tags: ai-safety, empirical, model-editing | 2024-10-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 86 |
| Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization Aaquib Syed, Abhay Sheshadri, Aidan Ewart, Gintare Karolina Dziugaite Published: 2024-10-16Area: Model EditingCitations: 19 Tags: ai-safety, empirical, interpretability, model-editing | 2024-10-16 | Model Editing | ai-safety, empirical, interpretability, model-editing | E6 / R3 (96%) | 19 |
| Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts Chao Du, Hongcheng Gao, Min Lin, Taihang Hu Published: 2024-10-16Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-16 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 18 |
| Breaking Chains: Unraveling the Links in Multi-Hop Knowledge Unlearning ChaeHun Park, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-10-17Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-10-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (96%) | 4 |
| Does your LLM truly unlearn? An embarrassingly simple approach to recover unlearned knowledge Fali Wang, Hui Liu, Qi He, Suhang Wang Published: 2024-10-21Area: Model EditingCitations: 51 Tags: ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 51 |
| Erasing Undesirable Concepts in Diffusion Models with Adversarial Preservation Anh Bui, Dinh Phung, Khanh Doan, Long Vuong Published: 2024-10-21Area: Model EditingCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 31 |
| Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation Engineering Alessio Devoto, Aryo Pradipta Gema, Giwon Hong, Hongru Wang Published: 2024-10-21Area: Model EditingCitations: 53 Tags: ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 53 |
| UnStar: Unlearning with Self-Taught Anti-Sample Reasoning for LLMs Mohan Kankanhalli, Murari Mandal, Yash Sinha Published: 2024-10-22Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 15 |