Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data Dana Alon, Donald Metzler, Tim Baumgärtner, Yang Gao Published: 2024-04-08Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 35 |
| Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge Cen Chen, Huiping Zhuang, Jianwei Wang, Weikai Lu Published: 2024-04-08Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 49 |
| Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning Licong Lin, Ruiqi Zhang, Song Mei, Yu Bai Published: 2024-04-08Area: Model EditingCitations: 348 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-04-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 348 |
| SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety Bertie Vidgen, Dirk Hovy, Fabio Pernisi, Paul Röttger Published: 2024-04-08Area: Surveys & ReviewsCitations: 69 Tags: ai-safety, survey, surveys-reviews | 2024-04-08 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (98%) | 69 |
| Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security Shaofeng Li, Yihe Fan, Yuxin Cao, Ziyao Liu Published: 2024-04-08Area: Multimodal SafetyCitations: 21 Tags: ai-safety, multimodal-safety, survey | 2024-04-08 | Multimodal Safety | ai-safety, multimodal-safety, survey | E6 / R3 (95%) | 21 |
| AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts Christopher Parisien, Erick Galinkin, Prasoon Varshney, Shaona Ghosh Published: 2024-04-09Area: Adversarial RobustnessCitations: 94 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 94 |
| Rethinking How to Evaluate Language Model Jailbreak Antonio Bianchi, Arjun Arunasalam, Hongyu Cai, Leo Y. Lin Published: 2024-04-09Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-04-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (94%) | 12 |
| LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models Elena Voita, Igor Tufanov, Javier Ferrando, Karen Hambardzumyan Published: 2024-04-10Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, mechanistic-interp, tool | 2024-04-10 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (95%) | 15 |
| SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models Chen Yan, Jiangyi Deng, Wenyuan Xu, Xiaoyu Ji Published: 2024-04-10Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 49 |
| AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs Huan Sun, Zeyi Liao Published: 2024-04-11Area: Adversarial RobustnessCitations: 153 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 153 |
| Latent Guard: a Safety Framework for Text-to-image Generation Ashkan Khakzar, Fabio Pizzati, Jindong Gu, Philip Torr Published: 2024-04-11Area: Multimodal SafetyCitations: 56 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 56 |
| LLM Agents can Autonomously Exploit One-day Vulnerabilities Akul Gupta, Daniel Kang, Richard Fang, Rohan Bindu Published: 2024-04-11Area: Agent SafetyCitations: 125 Tags: agent-safety, ai-safety, empirical | 2024-04-11 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 125 |
| JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models Minfeng Zhu, Sijia Wang, Wei Chen, Wei Zhang Published: 2024-04-12Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-04-12 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 8 |
| RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs Ameet Deshpande, Ashwin Kalyan, Bruno Castro da Silva, Karthik Narasimhan Published: 2024-04-12Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, survey | 2024-04-12 | Alignment Training | ai-safety, alignment-training, survey | E5 / R4 (95%) | 105 |
| Foundational Challenges in Assuring Alignment and Safety of Large Language Models Abulhair Saparov, Alan Chan, Aleksandar Petrov, Alexander Pan Published: 2024-04-15Area: Surveys & ReviewsCitations: 211 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-04-15 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (94%) | 211 |
| LLM Evaluators Recognize and Favor Their Own Generations Arjun Panickssery, Samuel R. Bowman, Shi Feng Published: 2024-04-15Area: Safety EvaluationCitations: 381 Tags: ai-safety, empirical, safety-evaluation | 2024-04-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 381 |
| Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback Bob M. Jacobs, Emanuel Tewolde, Eric Pacuit, Hailey Schoelkopf Published: 2024-04-16Area: Alignment TrainingCitations: 69 Tags: ai-safety, alignment-training, position | 2024-04-16 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 69 |
| Decomposing and Editing Predictions by Modeling Model Computation Aleksander Madry, Andrew Ilyas, Harshay Shah Published: 2024-04-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Offset Unlearning for Large Language Models Fei Wang, Fred Morstatter, Hoifung Poon, James Y. Huang Published: 2024-04-17Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 28 |
| Stepwise Alignment for Constrained Language Model Policy Optimization Akifumi Wachi, Rei Sato, Takumi Tanabe, Thien Q Tran Published: 2024-04-17Area: Alignment TrainingCitations: 17 Tags: ai-safety, alignment-training, empirical | 2024-04-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 17 |
| CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song, David Molnar Published: 2024-04-19Area: Safety EvaluationCitations: 71 Tags: ai-safety, benchmark, safety-evaluation | 2024-04-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 71 |
| Sophon: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models Haiqin Weng, Jiangyi Deng, Liangming Xia, Shengyuan Pang Published: 2024-04-19Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-04-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 15 |
| The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions Alex Beutel, Eric Wallace, Johannes Heidecke, Kai Xiao Published: 2024-04-19Area: Adversarial RobustnessCitations: 257 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 257 |
| Trojan Detection in Large Language Models: Insights from The Trojan Detection Challenge Bislan Ashinov, Bulat Nutfullin, Ekansh Verma, Narek Maloyan Published: 2024-04-21Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 18 |
| Automatic Discovery of Visual Circuits Achyuta Rajaram, Antonio Torralba, Jacob Andreas, Neil Chowdhury Published: 2024-04-22Area: Mechanistic Interp.Citations: 10 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-04-22 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 10 |
| Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs Florian Tramèr, Francesco Croce, Javier Rando, Kryštof Mitka Published: 2024-04-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, benchmark | 2024-04-22 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 24 |
| Holistic Safety and Responsibility Evaluations of Advanced AI Models Allan Dafoe, Christina Butterfield, Dawn Bloxwich, Iason Gabriel Published: 2024-04-22Area: Safety EvaluationCitations: 17 Tags: ai-safety, safety-evaluation, survey | 2024-04-22 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 17 |
| MAIA: A Multimodal Automated Interpretability Agent Achyuta Rajaram, Antonio Torralba, Evan Hernandez, Franklin Wang Published: 2024-04-22Area: Mechanistic Interp.Citations: 45 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2024-04-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E6 / R4 (95%) | 45 |
| Mechanistic Interpretability for AI Safety — A Review Efstratios Gavves, Leonard Bereska Published: 2024-04-22Area: Surveys & ReviewsCitations: 335 Tags: ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | 2024-04-22 | Surveys & Reviews | ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | E5 / R3 (93%) | 335 |
| Resistance Against Manipulative AI: key factors and possible actions Piotr Wilczyński, Przemysław Biecek, Wiktoria Mieleszczenko-Kowszewicz Published: 2024-04-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-04-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 7 |