Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning Chongyu Fan, Jiancheng Liu, Jinghan Jia, Licong Lin Published: 2024-10-09Area: Model EditingCitations: 82 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 82 |
| Sparse Autoencoders Reveal Universal Feature Spaces Across Large Language Models Ashkan Khakzar, Austin Meek, David Krueger, Fazl Barez Published: 2024-10-09Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 11 |
| Steering Large Language Models using Conceptors: Improving Addition-Based Activation Engineering Joris Postmus, Steven Abreu Published: 2024-10-09Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 15 |
| A Closer Look at Machine Unlearning for Large Language Models Chao Du, Kejiang Chen, Min Lin, Tianyu Pang Published: 2024-10-10Area: Model EditingCitations: 35 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-10-10 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 35 |
| Bilinear MLPs Enable Weight-Based Mechanistic Interpretability Alice Rigg, Jose M. Oramas, Lee Sharkey, Michael T. Pearce Published: 2024-10-10Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-10-10 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 19 |
| Efficient Dictionary Learning with Switch Sparse Autoencoders Anish Mudide, Christian Schroeder de Witt, Eric J. Michaud, Joshua Engels Published: 2024-10-10Area: Mechanistic Interp.Citations: 31 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 31 |
| Generalization from Starvation: Hints of Universality in LLM Knowledge Graph Learning David D. Baek, Max Tegmark, Yuxiao Li Published: 2024-10-10Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2024-10-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E8 / R3 (96%) | 3 |
| How Does Vision-Language Adaptation Impact the Safety of Vision Language Models? Geewook Kim, Hoyeon Chang, Hyunji Lee, Jiyeon Kim Published: 2024-10-10Area: Multimodal SafetyCitations: 4 Tags: ai-safety, empirical, multimodal-safety | 2024-10-10 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 4 |
| Mechanistic Permutability: Match Features Across Layers Daniil Gavrilov, Ian Maksimov, Nikita Balagansky Published: 2024-10-10Area: Mechanistic Interp.Citations: 14 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (98%) | 14 |
| The Geometry of Concepts: Sparse Autoencoder Feature Structure David D. Baek, Eric J. Michaud, Joshua Engels, Max Tegmark Published: 2024-10-10Area: Mechanistic Interp.Citations: 40 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 40 |
| Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models Ashia C. Wilson, Ayush Sekhari, Manish Raghavan, Rohan Alur Published: 2024-10-10Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-10-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger Published: 2024-10-11Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-10-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 49 |
| JurEE not Judges: safeguarding llm interactions with small, specialised Encoder Ensembles Dom Nasrabadi Published: 2024-10-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | 2 |
| RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process Chaowei Xiao, Peiran Wang, Xiaogeng Liu Published: 2024-10-11Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 9 |
| Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models Chao Shang, Jie Ma, Ling Liu, Llu铆s M脿rquez Published: 2024-10-11Area: Multimodal SafetyCitations: 16 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-10-11 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | 16 |
| Keys to Robust Edits: from Theoretical Insights to Practical Advances Futing Wang, Jianhao Yan, Yafu Li, Yue Zhang Published: 2024-10-12Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-10-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Safety-Aware Fine-Tuning of Large Language Models Hyeong Kyu Choi, Xuefeng Du, Yixuan Li Published: 2024-10-13Area: Alignment TrainingCitations: 38 Tags: ai-safety, alignment-training, empirical | 2024-10-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 38 |
| Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation Guozhi Liu, Li Shen, Qi Mu, Ruichao Mo Published: 2024-10-13Area: Alignment TrainingCitations: 31 Tags: ai-safety, alignment-training, empirical | 2024-10-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 31 |
| Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense Li Shen, Minhao Cheng, Nevin L. Zhang, Rui Min Published: 2024-10-13Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 8 |
| Jailbreak Instruction-Tuned LLMs via end-of-sentence MLP Re-weighting Bin Dong, Meitan Wang, Yifan Luo, Zhennan Zhou Published: 2024-10-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts Dongrui Liu, Hao Li, Jing Shao, Junchi Yan Published: 2024-10-14Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 42 |
| LLM Unlearning via Loss Adjustment with Only Forget Data Ankit Parag Shah, Chris Yuhao Liu, Jiaheng Wei, Jinlong Pang Published: 2024-10-14Area: Model EditingCitations: 55 Tags: ai-safety, empirical, model-editing | 2024-10-14 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 55 |
| Locking Down the Finetuned LLMs Safety Linyi Yang, Minjun Zhu, Ningyu Zhang, Yifan Wei Published: 2024-10-14Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-10-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 23 |
| AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment Furong Huang, Michael-Andrei Panaitescu-Liess, Pankayaraj Pathmanathan, Udari Madhushani Sehwag Published: 2024-10-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Analyzing (In)Abilities of SAEs via Formal Languages Abhinav Menon, David Krueger, Ekdeep Singh Lubana, Manish Shrivastava Published: 2024-10-15Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (95%) | 15 |
| Cognitive Overload Attack: Prompt Injection for Long Context Amin Karbasi, Bibek Upadhayay, Vahid Behzadan Published: 2024-10-15Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 13 |
| Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation Qizhang Li, Wangmeng Zuo, Xiaochen Yang, Yiwen Guo Published: 2024-10-15Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 3 |
| Improving Instruction-Following in Language Models through Activation Steering Alessandro Stolfo, Besmira Nushi, Eric Horvitz, Safoora Yousefi Published: 2024-10-15Area: Model EditingCitations: 86 Tags: ai-safety, empirical, model-editing | 2024-10-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 86 |
| Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models Ehsan Shareghi, Gholamreza Haffari, Hao Yang, Lizhen Qu Published: 2024-10-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (97%) | 11 |
| ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic Interpretability Han Li, Jun Xu, Kai Zheng, Weijie Yu Published: 2024-10-15Area: Mechanistic Interp.Citations: 68 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-10-15 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R4 (95%) | 68 |