Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Robust Concept Erasure Using Task Vectors Chinmay Hegde, Kelly O. Marshall, Minh Pham, Niv Cohen Published: 2024-04-04Area: Model EditingCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 27 |
| Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning Licong Lin, Ruiqi Zhang, Song Mei, Yu Bai Published: 2024-04-08Area: Model EditingCitations: 348 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-04-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 348 |
| Decomposing and Editing Predictions by Modeling Model Computation Aleksander Madry, Andrew Ilyas, Harshay Shah Published: 2024-04-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Offset Unlearning for Large Language Models Fei Wang, Fred Morstatter, Hoifung Poon, James Y. Huang Published: 2024-04-17Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 28 |
| Sophon: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models Haiqin Weng, Jiangyi Deng, Liangming Xia, Shengyuan Pang Published: 2024-04-19Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-04-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 15 |
| SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning Bharat Runwal, Bhavya Kailkhura, James Diffenderfer, Jiancheng Liu Published: 2024-04-28Area: Model EditingCitations: 98 Tags: ai-safety, empirical, model-editing | 2024-04-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 98 |
| LITO: Learnable Intervention for Truthfulness Optimization Farima Fatahi Bayat, H. V. Jagadish, Lu Wang, Xin Liu Published: 2024-05-01Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2024-05-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 3 |
| To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models George-Octavian B膬rbulescu, Peter Triantafillou Published: 2024-05-06Area: Model EditingCitations: 38 Tags: ai-safety, empirical, model-editing | 2024-05-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (93%) | 38 |
| Erasing Concepts from Text-to-Image Diffusion Models with Few-shot Unlearning Masane Fuchi, Tomohiro Takagi Published: 2024-05-12Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-05-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 25 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity Apratim Dey, Junjie Hu, Rheeya Uppaal, Yiqiao Zhong Published: 2024-05-22Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 21 |
| Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories Junyi Gao, Liantao Ma, Tianlong Wang, Xianfeng Jiao Published: 2024-05-26Area: Model EditingCitations: 57 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 57 |
| Large Scale Knowledge Washing Julian McAuley, Ruihan Wu, Xiusi Chen, Yu Wang Published: 2024-05-26Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 14 |
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models Bichen Wang, Bing Qin, Yanyan Zhao, Yixin Sun Published: 2024-06-04Area: Model EditingCitations: 19 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 19 |
| Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller Difan Zou, Fan Yin, Min Cai, Shichang Zhang Published: 2024-06-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E4 / R4 (96%) | 5 |
| PaCE: Parsimonious Concept Engineering for Large Language Models Aditya Chattopadhyay, Chris Callison-Burch, Darshan Thaker, Jinqi Luo Published: 2024-06-06Area: Model EditingCitations: 16 Tags: ai-safety, empirical, model-editing | 2024-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 16 |
| Aligning Large Language Models with Representation Editing: A Control Perspective Chao Zhang, Haorui Wang, Kai Wang, Lingkai Kong Published: 2024-06-10Area: Model EditingCitations: 49 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 49 |
| The Curse of Popularity: Popular Entities have Catastrophic Side Effects when Deleting Knowledge from Language Models Benjamin Heinzerling, Go Kamoda, Keisuke Sakaguchi, Kentaro Inui Published: 2024-06-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space Martin Tutek, Tomer Ashuach, Yonatan Belinkov Published: 2024-06-13Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| Towards Effective Evaluations and Comparisons for LLM Unlearning Methods Bo Han, Jianing Zhu, Masashi Sugiyama, Puning Yang Published: 2024-06-13Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 24 |
| Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs Abhimanyu Hans, Abhinav Bhatele, Gowthami Somepalli, Hamid Kazemi Published: 2024-06-14Area: Model EditingCitations: 54 Tags: ai-safety, empirical, model-editing | 2024-06-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 54 |
| Avoiding Copyright Infringement via Large Language Model Unlearning Eric Wong, Guangyao Dou, Kaize Ding, Qing Lyu Published: 2024-06-16Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 20 |
| RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models Chenhao Wang, Hongbang Yuan, Jiachun Li, Jun Zhao Published: 2024-06-16Area: Model EditingCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark, model-editing | 2024-06-16 | Model Editing | adversarial-robustness, ai-safety, benchmark, model-editing | E5 / R3 (95%) | 57 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations Rima Hazra, Sayan Layek, Somnath Banerjee, Soujanya Poria Published: 2024-06-17Area: Model EditingCitations: 26 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 26 |
| Soft Prompting for Unlearning in Large Language Models Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2024-06-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs Dennis Wei, Farhan Ahmed, Inkit Padhi, Nathalie Baracaldo Published: 2024-06-17Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 20 |