Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing Dongliang Guo, Junfeng Guo, Mengxuan Hu, Sheng Li Published: 2024-10-23Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 5 |
| Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks Aobo Yang, Bobbie Chern, Han Zhao, Jianfeng Chi Published: 2024-10-23Area: Adversarial RobustnessCitations: 36 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 36 |
| WAGLE: Strategic Weight Attribution for Effective and Modular Unlearning in Large Language Models Jiancheng Liu, Jinghan Jia, Nathalie Baracaldo, Parikshit Ram Published: 2024-10-23Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-10-23 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | 18 |
| Adversarial Attacks on Large Language Models Using Regularized Relaxation Chashi Mahiul Islam, Fatema Tabassum Liza, Sajib Biswas, Samuel Jacob Chacko Published: 2024-10-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 10 |
| Inference time LLM alignment in single and multidomain preference spectrum Kishaloy Halder, Manuel Mager, Monica Sunkara, Nikolaos Pappas Published: 2024-10-24Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-10-24 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 3 |
| Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs Chaojie Wang, Chris Yuhao Liu, Jiacai Liu, Jujie He Published: 2024-10-24Area: Alignment TrainingCitations: 245 Tags: ai-safety, alignment-training, empirical | 2024-10-24 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 245 |
| An Auditing Test To Detect Behavioral Shift in Language Models Leo Richter, Matt J. Kusner, Pasquale Minervini, Xuanli He Published: 2024-10-25Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-10-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 2 |
| Applying Sparse Autoencoders to Unlearn Knowledge in Language Models Arthur Conmy, Eoin Farrell, Yeu-Tong Lau Published: 2024-10-25Area: Model EditingCitations: 50 Tags: ai-safety, empirical, model-editing | 2024-10-25 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (95%) | 50 |
| Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization Dongqing Zou, Hengquan Guo, Honghao Wei, Jiawei Zhang Published: 2024-10-25Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-10-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 5 |
| RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction Changjiang Li, Jiacheng Liang, Tanqiu Jiang, Ting Wang Published: 2024-10-25Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 23 |
| Beyond Interpretability: The Gains of Feature Monosemanticity on Model Robustness Jingyi Cui, Qi Lei, Qi Zhang, Stefanie Jegelka Published: 2024-10-27Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-10-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R4 (94%) | 5 |
| Arithmetic Without Algorithms: Language Models Solve Math With a Bag of Heuristics Aaron Mueller, Anja Reusch, Yaniv Nikankin, Yonatan Belinkov Published: 2024-10-28Area: Mechanistic Interp.Citations: 74 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 74 |
| BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks Lin Luo, Xiang Zheng, Xingjun Ma, Yige Li Published: 2024-10-28Area: Multimodal SafetyCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | 22 |
| Group-SAE: Efficient Training of Sparse Autoencoders for Large Language Models via Layer Groups Davide Ghilardi, Federico Belotti, Marco Molinari Published: 2024-10-28Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 10 |
| One-Step is Enough: Sparse Autoencoders for Text-to-Image Diffusion Models Antonio Mari, Caglar Gulcehre, Chris Wendler, David Bau Published: 2024-10-28Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 18 |
| Reducing the Scope of Language Models with Circuit Breakers Chulaka Gunasekara, Danish Contractor, David Yunis, Siyu Huo Published: 2024-10-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring Han He, Honglin Mu, Libo Qin, Qingfu Zhu Published: 2024-10-28Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts Huan Sun, Jaylen Jones, Vishal Kumar, Zeyi Liao Published: 2024-10-29Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 8 |
| Embedding-based classifiers can detect prompt injection attacks Md. Ahsan Ayub, Subhabrata Majumdar Published: 2024-10-29Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 24 |
| IDEATOR: Jailbreaking Large Vision-Language Models Using Themselves Bo Wang, Ruofan Wang, Xiaosen Wang, Xingjun Ma Published: 2024-10-29Area: Multimodal SafetyCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (99%) | 9 |
| Learning and Unlearning of Fabricated Knowledge in Language Models Andrey Zhmoginov, Chen Sun, Mark Sandler, Max Vladymyrov Published: 2024-10-29Area: Training DynamicsCitations: 5 Tags: ai-safety, empirical, training-dynamics | 2024-10-29 | Training Dynamics | ai-safety, empirical, training-dynamics | E4 / R3 (94%) | 5 |
| Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rate Anil Ramakrishna, Bhanukiran Vinzamuri, Kai-Wei Chang, Mingyi Hong Published: 2024-10-29Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-10-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 24 |
| Controlling Language and Diffusion Models by Transporting Activations Arno Blaas, Luca Zappella, Marco Cuturi, Michal Klein Published: 2024-10-30Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-10-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 24 |
| Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector Fengbin Zhu, Jiancheng Lv, Jingkun Tang, Pan Zhou Published: 2024-10-30Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 5 |
| Pseudo-Conversation Injection for LLM Goal Hijacking Buhui Yao, Zheng Chen Published: 2024-10-31Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 4 |
| Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models Aashiq Muhamed, Mona Diab, Virginia Smith Published: 2024-11-01Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 10 |
| Emoji Attack: A Method for Misleading Judge LLMs in Safety Risk Detection N. Benjamin Erichson, Yuqi Liu, Zhipeng Wei Published: 2024-11-01Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 19 |
| Plentiful Jailbreaks with String Compositions Brian R.Y. Huang Published: 2024-11-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders Alasdair Paren, David Krueger, Fazl Barez, Luke Marks Published: 2024-11-02Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2024-11-02 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 19 |
| Rule Based Rewards for Language Model Safety Alec Helyar, Alex Beutel, Andrea Vallone, Ian Kivlichan Published: 2024-11-02Area: Alignment TrainingCitations: 108 Tags: ai-safety, alignment-training, empirical | 2024-11-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 108 |