Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications Boyi Wei, Kaixuan Huang, Mengdi Wang, Mengzhou Xia Published: 2024-02-07Area: Adversarial RobustnessCitations: 188 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 188 |
| Direct Language Model Alignment from Online AI Feedback Alexandre Rame, Biao Zhang, Bilal Piot, Felipe Llinares Published: 2024-02-07Area: Alignment TrainingCitations: 226 Tags: ai-safety, alignment-training, empirical | 2024-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (97%) | 226 |
| Opening the AI black box: program synthesis via mechanistic interpretability Anish Mudide, Chloe Loughridge, Eric J. Michaud, Isaac Liao Published: 2024-02-07Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-02-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R4 (96%) | 19 |
| SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models Bowen Dong, Dahua Lin, Jing Shao, Lijun Li Published: 2024-02-07Area: Safety EvaluationCitations: 193 Tags: ai-safety, benchmark, safety-evaluation | 2024-02-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 193 |
| Comprehensive Assessment of Jailbreak Attacks Against LLMs Junjie Chu, Michael Backes, Xinyue Shen, Yang Zhang Published: 2024-02-08Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R4 (99%) | 90 |
| Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia Guangyu Shen, Guanhong Tao, Kaiyuan Zhang, Lu Yan Published: 2024-02-08Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 18 |
| Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation Bolun Zhang, Rui Ye, Shuo Tang, Siheng Chen Published: 2024-02-08Area: Alignment TrainingCitations: 49 Tags: ai-safety, alignment-training, empirical | 2024-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 49 |
| Debating with More Persuasive LLMs Leads to More Truthful Answers Akbir Khan, Ansh Radhakrishnan, Dan Valentine, Edward Grefenstette Published: 2024-02-09Area: Scalable OversightCitations: 215 Tags: ai-safety, empirical, scalable-oversight | 2024-02-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 215 |
| Feedback Loops With Language Models Drive In-Context Reward Hacking Alexander Pan, Erik Jones, Jacob Steinhardt, Meena Jagadeesan Published: 2024-02-09Area: Deception & FailureCitations: 61 Tags: ai-safety, deception-failure, empirical | 2024-02-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 61 |
| StruQ: Defending Against Prompt Injection with Structured Queries Chawin Sitawarin, David Wagner, Julien Piet, Sizhe Chen Published: 2024-02-09Area: Adversarial RobustnessCitations: 185 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 185 |
| Whispers in the Machine: Confidentiality in LLM-integrated Systems Jonathan Evertz, Lea Sch枚nherr, Merlin Chlosta, Thorsten Eisenhofer Published: 2024-02-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| ODIN: Disentangled Reward Mitigates Hacking in RLHF Bryan Catanzaro, Chen Zhu, Davit Soselia, Heng Huang Published: 2024-02-11Area: Alignment TrainingCitations: 111 Tags: ai-safety, alignment-training, empirical | 2024-02-11 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 111 |
| Summing Up the Facts: Additive Mechanisms Behind Factual Recall in LLMs Alan Cooney, Bilal Chughtai, Neel Nanda Published: 2024-02-11Area: Mechanistic Interp.Citations: 31 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (93%) | 31 |
| The Reasons that Agents Act: Intention and Instrumental Goals Francesca Toni, Francesco Belardinelli, Francis Rhys Ward, Matt MacDermott Published: 2024-02-11Area: Agent SafetyCitations: 22 Tags: agent-safety, ai-safety, theoretical | 2024-02-11 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (96%) | 22 |
| PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models Binghui Wang, Jinyuan Jia, Runpeng Geng, Wei Zou Published: 2024-02-12Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 111 |
| Secret Collusion Among Generative AI Agents Christian Schroeder de Witt, Lewis Hammond, Martin Strohmeier, Mikhail Baranchuk Published: 2024-02-12Area: Agent SafetyCitations: 59 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2024-02-12 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 59 |
| Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 106 |
| COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability Bin Hu, Fangxu Yu, Huan Zhang, Lianhui Qin Published: 2024-02-13Area: Adversarial RobustnessCitations: 157 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 157 |
| Rethinking Machine Unlearning for Large Language Models Chris Yuhao Liu, Hang Li, Jinghan Jia, Kush R. Varshney Published: 2024-02-13Area: Model EditingCitations: 227 Tags: ai-safety, alignment-training, model-editing, safety-evaluation, survey | 2024-02-13 | Model Editing | ai-safety, alignment-training, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 227 |
| Test-Time Backdoor Attacks on Multimodal Large Language Models Chao Du, Dong Lu, Min Lin, Qian Liu Published: 2024-02-13Area: Multimodal SafetyCitations: 39 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (98%) | 39 |
| Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation Alicia Parrish, Charvi Rastogi, Erin van Liemt, Hannah Rose Kirk Published: 2024-02-14Area: Safety EvaluationCitations: 19 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-14 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 19 |
| Attacking Large Language Models with Projected Gradient Descent Johannes Gasteiger, M. H. I. Abdalla, Simon Geisler, Stephan G眉nnemann Published: 2024-02-14Area: Adversarial RobustnessCitations: 105 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 105 |
| Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey Chao Yang, Jing Shao, Yu Qiao, Zhanhui Zhou Published: 2024-02-14Area: Surveys & ReviewsCitations: 140 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-02-14 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (98%) | 140 |
| InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling Dacheng Tao, Lefei Zhang, Liang Ding, Rong Bao Published: 2024-02-14Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2024-02-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 63 |
| Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks Grigorios G. Chrysos, Markos Georgopoulos, Volkan Cevher, Yixin Cheng Published: 2024-02-14Area: Adversarial RobustnessCitations: 25 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 25 |
| SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding Bill Yuchen Lin, Fengqing Jiang, Jinyuan Jia, Luyao Niu Published: 2024-02-14Area: Adversarial RobustnessCitations: 217 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 217 |
| Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space David Dobre, Gauthier Gidel, Leo Schwinn, Sophie Xhonneux Published: 2024-02-14Area: Adversarial RobustnessCitations: 83 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 83 |
| A StrongREJECT for Empty Jailbreaks Alexandra Souly, Dillon Bowen, Elvis Hsieh, Justin Svegliato Published: 2024-02-15Area: Safety EvaluationCitations: 217 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-15 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 217 |
| A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents Boyuan Zheng, Chaowei Xiao, Huan Sun, Lingbo Mo Published: 2024-02-15Area: Agent SafetyCitations: 23 Tags: adversarial-robustness, agent-safety, ai-safety, survey | 2024-02-15 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, survey | E6 / R4 (97%) | 23 |
| PAL: Proxy-Guided Black-Box Attack on Large Language Models Alexandre Araujo, Chawin Sitawarin, David Wagner, Norman Mu Published: 2024-02-15Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 50 |