Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Sophon: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models Haiqin Weng, Jiangyi Deng, Liangming Xia, Shengyuan Pang Published: 2024-04-19Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-04-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 15 |
| Decomposing and Editing Predictions by Modeling Model Computation Aleksander Madry, Andrew Ilyas, Harshay Shah Published: 2024-04-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Offset Unlearning for Large Language Models Fei Wang, Fred Morstatter, Hoifung Poon, James Y. Huang Published: 2024-04-17Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 28 |
| Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning Licong Lin, Ruiqi Zhang, Song Mei, Yu Bai Published: 2024-04-08Area: Model EditingCitations: 348 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-04-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 348 |
| Locating and Editing Factual Associations in Mamba Arnab Sen Sharma, David Atkinson, David Bau Published: 2024-04-04Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 37 |
| Robust Concept Erasure Using Task Vectors Chinmay Hegde, Kelly O. Marshall, Minh Pham, Niv Cohen Published: 2024-04-04Area: Model EditingCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 27 |
| Digital Forgetting in Large Language Models: A Survey of Unlearning Methods Alberto Blanco-Justicia, Benet Manzanares, David S谩nchez, Guillem Collell Published: 2024-04-02Area: Model EditingCitations: 45 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-04-02 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (96%) | 45 |
| NL-ITI: Optimizing Probing and Intervention for Improvement of ITI Method Adam Cieslak, Adam Wiacek, Artur Janicki, Jakub Hoscilowicz Published: 2024-03-27Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-03-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 5 |
| Detoxifying Large Language Models via Knowledge Editing Huajun Chen, Jindong Wang, Linyi Yang, Mengru Wang Published: 2024-03-21Area: Model EditingCitations: 93 Tags: ai-safety, empirical, model-editing | 2024-03-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 93 |
| Hiding and Recovering Knowledge in Text-to-Image Diffusion Models via Learnable Prompts Anh Bui, Dinh Phung, Khanh Doan, Paul Montague Published: 2024-03-18Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-03-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| Ethos: Rectifying Language Models in Orthogonal Parameter Space Lei Gao, Murali Annavaram, Salman Avestimehr, Tingting Tang Published: 2024-03-13Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 20 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| MACE: Mass Concept Erasure in Diffusion Models Adams Wai-Kin Kong, Leyang Li, Shilin Lu, Yanzhu Liu Published: 2024-03-10Area: Model EditingCitations: 232 Tags: ai-safety, empirical, model-editing | 2024-03-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 232 |
| Extending Activation Steering to Broad Skills and Multiple Behaviours Massimo Poesio, Nandi Schoots, Teun van der Weij Published: 2024-03-09Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-03-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | 26 |
| Guardrail Baselines for Unlearning in LLMs Pratiksha Thaker, Virginia Smith, Yash Maurya Published: 2024-03-05Area: Model EditingCitations: 84 Tags: ai-safety, empirical, model-editing | 2024-03-05 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 84 |
| Dissecting Language Models: Machine Unlearning via Selective Pruning Nandi Schoots, Nicholas Pochinkov Published: 2024-03-02Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2024-03-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 34 |
| Corrective Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2024-02-21Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 23 |
| UnlearnCanvas: A Stylized Image Dataset to Benchmark Machine Unlearning for Diffusion Models Jiancheng Liu, Jinghan Jia, Sijia Liu, Xiaoming Liu Published: 2024-02-19Area: Model EditingCitations: 22 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-02-19 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (96%) | 22 |
| Towards Safer Large Language Models through Machine Unlearning Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-02-15Area: Model EditingCitations: 134 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 134 |
| UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models Hongzhou Lin, Ivan Vulic, Mikhail Belkin, Ramon Huerta Published: 2024-02-15Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 23 |
| Rethinking Machine Unlearning for Large Language Models Chris Yuhao Liu, Hang Li, Jinghan Jia, Kush R. Varshney Published: 2024-02-13Area: Model EditingCitations: 227 Tags: ai-safety, alignment-training, model-editing, safety-evaluation, survey | 2024-02-13 | Model Editing | ai-safety, alignment-training, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 227 |
| InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance Botian Jiang, Chenkun Tan, Dong Zhang, Ke Ren Published: 2024-01-20Area: Model EditingCitations: 78 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-01-20 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 78 |
| EraseDiff: Erasing Data Influence in Diffusion Models Jing Wu, Mehrtash Harandi, Munawar Hayat, Trung Le Published: 2024-01-11Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-01-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 28 |
| A Comprehensive Study of Knowledge Editing for Large Language Models Bozhong Tian, Fei Huang, Huajun Chen, Jia-Chen Gu Published: 2024-01-02Area: Model EditingCitations: 134 Tags: ai-safety, model-editing, survey | 2024-01-02 | Model Editing | ai-safety, model-editing, survey | E5 / R3 (95%) | 134 |
| DUnE: Dataset for Unified Editing Afra Feyza Aky眉rek, Derry Wijaya, Eric Pan, Garry Kuwanto Published: 2023-11-27Area: Model EditingCitations: 20 Tags: ai-safety, benchmark, model-editing | 2023-11-27 | Model Editing | ai-safety, benchmark, model-editing | E5 / R4 (95%) | 20 |
| Knowledge Unlearning for LLMs: Tasks, Methods, and Challenges Dan Qu, Hao Zhang, Heyu Chang, Nianwen Si Published: 2023-11-27Area: Model EditingCitations: 41 Tags: ai-safety, model-editing, safety-evaluation, survey | 2023-11-27 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R5 (95%) | 41 |
| Do Localization Methods Actually Localize Memorized Data in LLMs? A Tale of Two Benchmarks Jesse Thomason, Robin Jia, Ting-Yun Chang Published: 2023-11-15Area: Model EditingCitations: 26 Tags: ai-safety, benchmark, model-editing | 2023-11-15 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (93%) | 26 |
| DEPN: Detecting and Editing Privacy Neurons in Pretrained Language Models Chao Bian, Deyi Xiong, Junzhuo Li, Minghui Xu Published: 2023-10-31Area: Model EditingCitations: 85 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (96%) | 85 |
| Unlearn What You Want to Forget: Efficient Unlearning for LLMs Diyi Yang, Jiaao Chen Published: 2023-10-31Area: Model EditingCitations: 231 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 231 |
| SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation Chongyu Fan, Dennis Wei, Eric Wong, Jiancheng Liu Published: 2023-10-19Area: Model EditingCitations: 290 Tags: ai-safety, empirical, model-editing | 2023-10-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 290 |