Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Whispers in the Machine: Confidentiality in LLM-integrated Systems Jonathan Evertz, Lea Sch枚nherr, Merlin Chlosta, Thorsten Eisenhofer Published: 2024-02-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| ODIN: Disentangled Reward Mitigates Hacking in RLHF Bryan Catanzaro, Chen Zhu, Davit Soselia, Heng Huang Published: 2024-02-11Area: Alignment TrainingCitations: 111 Tags: ai-safety, alignment-training, empirical | 2024-02-11 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 111 |
| Summing Up the Facts: Additive Mechanisms Behind Factual Recall in LLMs Alan Cooney, Bilal Chughtai, Neel Nanda Published: 2024-02-11Area: Mechanistic Interp.Citations: 31 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (93%) | 31 |
| PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models Binghui Wang, Jinyuan Jia, Runpeng Geng, Wei Zou Published: 2024-02-12Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 111 |
| Secret Collusion Among Generative AI Agents Christian Schroeder de Witt, Lewis Hammond, Martin Strohmeier, Mikhail Baranchuk Published: 2024-02-12Area: Agent SafetyCitations: 59 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2024-02-12 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 59 |
| Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 106 |
| COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability Bin Hu, Fangxu Yu, Huan Zhang, Lianhui Qin Published: 2024-02-13Area: Adversarial RobustnessCitations: 157 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 157 |
| Test-Time Backdoor Attacks on Multimodal Large Language Models Chao Du, Dong Lu, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 39 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (98%) | 39 |
| Attacking Large Language Models with Projected Gradient Descent Johannes Gasteiger, M. H. I. Abdalla, Simon Geisler, Stephan G眉nnemann Published: 2024-02-14Area: Adversarial RobustnessCitations: 105 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 105 |
| InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling Dacheng Tao, Lefei Zhang, Liang Ding, Rong Bao Published: 2024-02-14Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2024-02-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 63 |
| Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks Grigorios G. Chrysos, Markos Georgopoulos, Volkan Cevher, Yixin Cheng Published: 2024-02-14Area: Adversarial RobustnessCitations: 25 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 25 |
| SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding Bill Yuchen Lin, Fengqing Jiang, Jinyuan Jia, Luyao Niu Published: 2024-02-14Area: Adversarial RobustnessCitations: 217 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 217 |
| Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space David Dobre, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-02-14Area: Adversarial RobustnessCitations: 83 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 83 |
| PAL: Proxy-Guided Black-Box Attack on Large Language Models Alexandre Araujo, Chawin Sitawarin, David Wagner, Norman Mu Published: 2024-02-15Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 50 |
| Recovering the Pre-Fine-Tuning Weights of Generative Models Eliahu Horwitz, Jonathan Kahana, Yedid Hoshen Published: 2024-02-15Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |
| Towards Safer Large Language Models through Machine Unlearning Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-02-15Area: Model EditingCitations: 134 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 134 |
| UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models Hongzhou Lin, Ivan Vulic, Mikhail Belkin, Ramon Huerta Published: 2024-02-15Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 23 |
| Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE) Alex Oesterling, Flavio P. Calmon, Himabindu Lakkaraju, Suraj Srinivas Published: 2024-02-16Area: Representation AnalysisCitations: 91 Tags: ai-safety, empirical, representation-analysis | 2024-02-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (93%) | 91 |
| When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers Advait Chirmule, Bimal Gajera, Chitta Baral, Divij Handa Published: 2024-02-16Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 33 |
| Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals Alberto Cazzaniga, Bernhard Sch枚lkopf, Diego Doimo, Francesco Ortu Published: 2024-02-18Area: Mechanistic Interp.Citations: 35 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (95%) | 35 |
| A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task Abhay Sheshadri, Christian Bartelt, Jannik Brinkmann, Paul Swoboda Published: 2024-02-19Area: Mechanistic Interp.Citations: 48 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 48 |
| ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Luyao Niu Published: 2024-02-19Area: Adversarial RobustnessCitations: 215 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 215 |
| Dictionary Learning Improves Patch-Free Circuit Discovery in Mechanistic Interpretability: A Case Study on Othello-GPT Qinyuan Cheng, Qiong Tang, Tianxiang Sun, Xipeng Qiu Published: 2024-02-19Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-02-19 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 25 |
| Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! Chao Yang, Jiaheng Liu, Jie Liu, Wanli Ouyang Published: 2024-02-19Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 35 |
| Query-Based Adversarial Prompt Generation Ema Borevkovic, Florian Tram猫r, Jonathan Hayase, Milad Nasr Published: 2024-02-19Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 48 |
| Defending Jailbreak Prompts via In-Context Adversarial Game Haomin Zhuang, Hongyan Bao, Kehan Guo, Taicheng Guo Published: 2024-02-20Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 32 |
| Is the System Message Really Important to Jailbreaks in Large Language Models? Ke Li, Xiaotian Zou, Yongkang Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 24 |
| Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive Arka Pal, Colin White, Deep Karkhanis, Manley Roberts Published: 2024-02-20Area: Alignment TrainingCitations: 219 Tags: ai-safety, alignment-training, empirical | 2024-02-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 219 |
| The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative Chengshuai Zhao, Huan Liu, Raha Moraffah, Tianlong Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 21 |
| Coercing LLMs to do and reveal (almost) anything Alex Stein, Jonas Geiping, Khalid Saifullah, Manli Shu Published: 2024-02-21Area: Adversarial RobustnessCitations: 86 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 86 |