Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Steering Without Side Effects: Improving Post-Deployment Control of Language Models Alexander Lyzhov, Asa Cooper Stickland, Jacob Pfau, Salsabila Mahdi Published: 2024-06-21Area: Model EditingCitations: 41 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-06-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 41 |
| Textual Unlearning Gives a False Sense of Unlearning Jiacheng Du, Jiahui Hu, Jie Zhang, Kui Ren Published: 2024-06-19Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (97%) | 9 |
| Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning Shengyuan Hu, Virginia Smith, Yiwei Fu, Zhiwei Steven Wu Published: 2024-06-19Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2024-06-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 40 |
| SNAP: Unlearning Selective Knowledge in Large Language Models with Negative Instructions Daniel Rim, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-06-18Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 7 |
| Stealth edits for provably fixing or attacking large language models Alexander Bastounis, Alexander N. Gorban, Desmond J. Higham, Ivan Y. Tyukin Published: 2024-06-18Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2024-06-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 2 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations Rima Hazra, Sayan Layek, Somnath Banerjee, Soujanya Poria Published: 2024-06-17Area: Model EditingCitations: 26 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 26 |
| Soft Prompting for Unlearning in Large Language Models Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2024-06-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs Dennis Wei, Farhan Ahmed, Inkit Padhi, Nathalie Baracaldo Published: 2024-06-17Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 20 |
| Avoiding Copyright Infringement via Large Language Model Unlearning Eric Wong, Guangyao Dou, Kaize Ding, Qing Lyu Published: 2024-06-16Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 20 |
| RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models Chenhao Wang, Hongbang Yuan, Jiachun Li, Jun Zhao Published: 2024-06-16Area: Model EditingCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark, model-editing | 2024-06-16 | Model Editing | adversarial-robustness, ai-safety, benchmark, model-editing | E5 / R3 (95%) | 57 |
| Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs Abhimanyu Hans, Abhinav Bhatele, Gowthami Somepalli, Hamid Kazemi Published: 2024-06-14Area: Model EditingCitations: 54 Tags: ai-safety, empirical, model-editing | 2024-06-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 54 |
| REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space Martin Tutek, Tomer Ashuach, Yonatan Belinkov Published: 2024-06-13Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| Towards Effective Evaluations and Comparisons for LLM Unlearning Methods Bo Han, Jianing Zhu, Masashi Sugiyama, Puning Yang Published: 2024-06-13Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 24 |
| Aligning Large Language Models with Representation Editing: A Control Perspective Chao Zhang, Haorui Wang, Kai Wang, Lingkai Kong Published: 2024-06-10Area: Model EditingCitations: 49 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 49 |
| The Curse of Popularity: Popular Entities have Catastrophic Side Effects when Deleting Knowledge from Language Models Benjamin Heinzerling, Go Kamoda, Keisuke Sakaguchi, Kentaro Inui Published: 2024-06-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| PaCE: Parsimonious Concept Engineering for Large Language Models Aditya Chattopadhyay, Chris Callison-Burch, Darshan Thaker, Jinqi Luo Published: 2024-06-06Area: Model EditingCitations: 16 Tags: ai-safety, empirical, model-editing | 2024-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 16 |
| RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models Bichen Wang, Bing Qin, Yanyan Zhao, Yixin Sun Published: 2024-06-04Area: Model EditingCitations: 19 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 19 |
| Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller Difan Zou, Fan Yin, Min Cai, Shichang Zhang Published: 2024-06-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E4 / R4 (96%) | 5 |
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories Junyi Gao, Liantao Ma, Tianlong Wang, Xianfeng Jiao Published: 2024-05-26Area: Model EditingCitations: 57 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 57 |
| Large Scale Knowledge Washing Julian McAuley, Ruihan Wu, Xiusi Chen, Yu Wang Published: 2024-05-26Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 14 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity Apratim Dey, Junjie Hu, Rheeya Uppaal, Yiqiao Zhong Published: 2024-05-22Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 21 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| Erasing Concepts from Text-to-Image Diffusion Models with Few-shot Unlearning Masane Fuchi, Tomohiro Takagi Published: 2024-05-12Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-05-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 25 |
| To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models George-Octavian B膬rbulescu, Peter Triantafillou Published: 2024-05-06Area: Model EditingCitations: 38 Tags: ai-safety, empirical, model-editing | 2024-05-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (93%) | 38 |
| LITO: Learnable Intervention for Truthfulness Optimization Farima Fatahi Bayat, H. V. Jagadish, Lu Wang, Xin Liu Published: 2024-05-01Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2024-05-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 3 |
| SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning Bharat Runwal, Bhavya Kailkhura, James Diffenderfer, Jiancheng Liu Published: 2024-04-28Area: Model EditingCitations: 98 Tags: ai-safety, empirical, model-editing | 2024-04-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 98 |