Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Lockpicking LLMs: A Logit-Based Jailbreak Using Token-level Manipulation Gelei Deng, Kailong Wang, Ling Shi, Shengquan Chen Published: 2024-05-20Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Sparse Autoencoders Enable Scalable and Reliable Circuit Identification in Language Models Charles O'Neill, Thang Bui Published: 2024-05-21Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-21 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 11 |
| Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming Jianhong Wang, Jiaxu Liu, Meng Fang, Sihao Wu Published: 2024-05-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Automatically Identifying Local and Global Circuits with Linear Computation Graphs Fukang Zhu, Junxuan Wang, Wentao Shu, Xipeng Qiu Published: 2024-05-22Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 20 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| LIRE: Listwise Reward Enhancement for Preference Alignment Junbo Guo, Lei Zhang, Mingye Zhu, Yi Liu Published: 2024-05-22Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, empirical | 2024-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity Apratim Dey, Junjie Hu, Rheeya Uppaal, Yiqiao Zhong Published: 2024-05-22Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 21 |
| Safety Alignment for Vision Language Models Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-05-22Area: Multimodal SafetyCitations: 20 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 20 |
| TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models Gongshen Liu, Pengzhou Cheng, Ping Yi, Tianjie Ju Published: 2024-05-22Area: Adversarial RobustnessCitations: 56 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 56 |
| MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability Bing Qin, Danyang Zhao, Dongliang Xu, Liangyu Huo Published: 2024-05-23Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 15 |
| Not All Language Model Features Are Linear Eric J. Michaud, Isaac Liao, Joshua Engels, Max Tegmark Published: 2024-05-23Area: Mechanistic Interp.Citations: 106 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | 106 |
| Representation Noising: A Defence Mechanism Against Harmful Finetuning Carsten Maple, David Atanasov, Domenic Rosati, Frank Rudzicz Published: 2024-05-23Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (94%) | 66 |
| SimPO: Simple Preference Optimization with a Reference-Free Reward Danqi Chen, Mengzhou Xia, Yu Meng Published: 2024-05-23Area: Alignment TrainingCitations: 850 Tags: ai-safety, alignment-training, empirical | 2024-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 850 |
| Efficient Adversarial Training in LLMs with Continuous Attacks Alessandro Sordoni, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-05-24Area: Adversarial RobustnessCitations: 103 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (100%) | 103 |
| No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks Chak Tou Leong, Hanlin Wang, Jian Wang, Kaishuai Xu Published: 2024-05-25Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 31 |
| Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character Bo Li, Chaowei Xiao, Muhao Chen, Siyuan Ma Published: 2024-05-25Area: Multimodal SafetyCitations: 59 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 59 |
| Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories Junyi Gao, Liantao Ma, Tianlong Wang, Xianfeng Jiao Published: 2024-05-26Area: Model EditingCitations: 57 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 57 |
| Large Scale Knowledge Washing Julian McAuley, Ruihan Wu, Xiusi Chen, Yu Wang Published: 2024-05-26Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 14 |
| Medical MLLM Is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models Chengwei Pan, Hantao Zhang, Hao Wang, Jiawen Xi Published: 2024-05-26Area: Multimodal SafetyCitations: 15 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 15 |
| Pruning for Robust Concept Erasing in Diffusion Models Chang Xu, Juan Cao, Tianyun Yang Published: 2024-05-26Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 25 |
| Cross-Modal Safety Alignment: Is textual unlearning all you need? Amit K. Roy-Chowdhury, Chengyu Song, Erfan Shayegani, M. Salman Asif Published: 2024-05-27Area: Multimodal SafetyCitations: 25 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-27 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 25 |
| Exploiting the Layered Intrinsic Dimensionality of Deep Models for Practical Adversarial Training Enes Altinisik, Hassan Sajjad, Husrev Taha Sencar, Safa Messaoud Published: 2024-05-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 1 |
| From Neurons to Neutrons: A Case Study in Interpretability Mike Williams, Niklas Nolte, Ouail Kitouni, Sokratis Trifinopoulos Published: 2024-05-27Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-05-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 4 |
| Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models Duen Horng Chau, Matthew Hull, Pin-Yu Chen, ShengYun Peng Published: 2024-05-27Area: Safety EvaluationCitations: 51 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2024-05-27 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (94%) | 51 |
| Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin, Chun-Ying Huang Published: 2024-05-27Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, empirical | 2024-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 105 |
| Exploiting LLM Quantization Jingxuan He, Kazuki Egashira, Mark Vero, Martin Vechev Published: 2024-05-28Area: Adversarial RobustnessCitations: 53 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 53 |
| Improved Generation of Adversarial Examples Against Safety-aligned LLMs Hao Chen, Qizhang Li, Wangmeng Zuo, Yiwen Guo Published: 2024-05-28Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 12 |
| Knowledge Circuits in Pretrained Transformers Huajun Chen, Mengru Wang, Ningyu Zhang, Shumin Deng Published: 2024-05-28Area: Mechanistic Interp.Citations: 44 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 44 |
| Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-05-28Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 67 |
| Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization Bochuan Cao, Fenglong Ma, Jinghui Chen, Lu Lin Published: 2024-05-28Area: Representation AnalysisCitations: 81 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2024-05-28 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 81 |