Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Training Data Extraction From Pre-trained Language Models: A Survey Shotaro Ishihara Published: 2023-05-25Area: Safety EvaluationCitations: 57 Tags: ai-safety, safety-evaluation, survey | 2023-05-25 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (94%) | 57 |
| On Evaluating Adversarial Robustness of Large Vision-Language Models Chao Du, Chongxuan Li, Min Lin, Ngai-Man Cheung Published: 2023-05-26Area: Multimodal SafetyCitations: 287 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R3 (97%) | 287 |
| Training Socially Aligned Language Models in Simulated Human Society Andrew M. Dai, Chenyan Jia, Denny Zhou, Diyi Yang Published: 2023-05-26Area: Alignment TrainingCitations: 91 Tags: ai-safety, alignment-training, empirical | 2023-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 91 |
| AI Models Collapse When Trained on Recursively Generated Data Ilia Shumailov, Nicolas Papernot, Ross Anderson, Yarin Gal Published: 2023-05-27Area: Training DynamicsCitations: 427 Tags: ai-safety, empirical, training-dynamics | 2023-05-27 | Training Dynamics | ai-safety, empirical, training-dynamics | E6 / R3 (97%) | 427 |
| Query-Efficient Black-Box Red Teaming via Bayesian Optimization Deokjae Lee, Hwaran Lee, Hyun Oh Song, Jin-Hwa Kim Published: 2023-05-27Area: Safety EvaluationCitations: 31 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-05-27 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 31 |
| Direct Preference Optimization: Your Language Model is Secretly a Reward Model Archit Sharma, Chelsea Finn, Christopher D. Manning, Eric Mitchell Published: 2023-05-29Area: Alignment TrainingCitations: 7298 Tags: ai-safety, alignment-training, empirical | 2023-05-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 7298 |
| Intent-aligned AI systems deplete human agency: the need for agency foundations research in AI safety Ben Smith, Catalin Mitelut, Peter Vamplew Published: 2023-05-30Area: Formal/TheoreticalCitations: 7 Tags: ai-safety, formaltheoretical, theoretical | 2023-05-30 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (96%) | 7 |
| Let's Verify Step by Step Bowen Baker, Harri Edwards, Hunter Lightman, Ilya Sutskever Published: 2023-05-31Area: Alignment TrainingCitations: 2550 Tags: ai-safety, alignment-training, empirical | 2023-05-31 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2550 |
| Neuron to Graph: Interpreting Language Model Neurons at Scale Alex Foote, Esben Kran, Fazl Barez, Ioannis Konstas Published: 2023-05-31Area: Mechanistic Interp.Citations: 28 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-05-31 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (94%) | 28 |
| Learning Transformer Programs Alexander Wettig, Dan Friedman, Danqi Chen Published: 2023-06-01Area: Mechanistic Interp.Citations: 48 Tags: ai-safety, empirical, mechanistic-interp | 2023-06-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 48 |
| Fine-Grained Human Feedback Gives Better Rewards for Language Model Training Alane Suhr, Hannaneh Hajishirzi, Mari Ostendorf, Noah A. Smith Published: 2023-06-02Area: Alignment TrainingCitations: 430 Tags: ai-safety, alignment-training, empirical | 2023-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 430 |
| Inference-Time Intervention: Eliciting Truthful Answers from a Language Model Fernanda Vi脙漏gas, Hanspeter Pfister, Kenneth Li, Martin Wattenberg Published: 2023-06-06Area: Representation AnalysisCitations: 897 Tags: ai-safety, empirical, representation-analysis | 2023-06-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 897 |
| LEACE: Perfect Linear Concept Erasure in Closed Form David Schneider-Joseph, Edward Raff, Nora Belrose, Ryan Cotterell Published: 2023-06-06Area: Representation AnalysisCitations: 175 Tags: ai-safety, empirical, representation-analysis | 2023-06-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (96%) | 175 |
| PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts Hao Chen, Jiaheng Zhou, Jindong Wang, Kaijie Zhu Published: 2023-06-07Area: Adversarial RobustnessCitations: 235 Tags: adversarial-robustness, ai-safety, benchmark | 2023-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 235 |
| Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards Alexandre Rame, Corentin Dancette, Guillaume Couairon, Jean-Baptiste Gaya Published: 2023-06-07Area: Alignment TrainingCitations: 216 Tags: ai-safety, alignment-training, empirical | 2023-06-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 216 |
| Prompt Injection attack against LLM-integrated Applications Gelei Deng, Haoyu Wang, Kailong Wang, Tianwei Zhang Published: 2023-06-08Area: Adversarial RobustnessCitations: 620 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 620 |
| Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena Dacheng Li, Eric P. Xing, Hao Zhang, Ion Stoica Published: 2023-06-09Area: Safety EvaluationCitations: 7108 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 7108 |
| Adversarial Attacks on the Interpretation of Neuron Activation Maximization Alexander Fulleringer, Eugene Belilovsky, G茅raldin Nanfack, Jonathan Marty Published: 2023-06-12Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 12 |
| Explore, Establish, Exploit: Red Teaming Language Models from Scratch Dylan Hadfield-Menell, Gatlen Culp, Jason Lin, Joe Kwon Published: 2023-06-15Area: Safety EvaluationCitations: 125 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 125 |
| Inverse Scaling: When Bigger Isn't Better Aaron Mueller, Alexander Lyzhov, Alicia Parrish, Ameya Prabhu Published: 2023-06-15Area: Safety EvaluationCitations: 189 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 189 |
| Evaluating Superhuman Models with Consistency Checks Daniel Paleka, Florian Tram猫r, Lukas Fluri Published: 2023-06-16Area: Scalable OversightCitations: 49 Tags: ai-safety, empirical, scalable-oversight | 2023-06-16 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 49 |
| DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Bo Li, Boxin Wang, Chejian Xu, Chenhui Zhang Published: 2023-06-20Area: Safety EvaluationCitations: 575 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-06-20 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 575 |
| An Overview of Catastrophic AI Risks Dan Hendrycks, Mantas Mazeika, Thomas Woodside Published: 2023-06-21Area: Surveys & ReviewsCitations: 258 Tags: ai-safety, survey, surveys-reviews | 2023-06-21 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R3 (100%) | 258 |
| Visual Adversarial Examples Jailbreak Aligned Large Language Models Ashwinee Panda, Kaixuan Huang, Mengdi Wang, Peter Henderson Published: 2023-06-22Area: Multimodal SafetyCitations: 295 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-06-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 295 |
| Are Aligned Neural Networks Adversarially Aligned? Anas Awadalla, Christopher A. Choquette-Choo, Daphne Ippolito, Florian Tramer Published: 2023-06-26Area: Adversarial RobustnessCitations: 325 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 325 |
| On the Exploitability of Instruction Tuning Chaowei Xiao, Chen Zhu, Jiongxiao Wang, Jonas Geiping Published: 2023-06-28Area: Adversarial RobustnessCitations: 135 Tags: adversarial-robustness, ai-safety, empirical | 2023-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 135 |
| Preference Ranking Optimization for Human Alignment Bowen Yu, Feifan Song, Fei Huang, Haiyang Yu Published: 2023-06-30Area: Alignment TrainingCitations: 340 Tags: ai-safety, alignment-training, empirical | 2023-06-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 340 |
| The Clock and the Pizza: Two Stories in Mechanistic Explanation of Neural Networks Jacob Andreas, Max Tegmark, Ziming Liu, Ziqian Zhong Published: 2023-06-30Area: Mechanistic Interp.Citations: 145 Tags: ai-safety, empirical, mechanistic-interp | 2023-06-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 145 |
| Evaluating Shutdown Avoidance of Language Models in Textual Scenarios Leon Lang, Simon Lermen, Teun van der Weij Published: 2023-07-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2023-07-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 7 |
| Hoodwinked: Deception and Cooperation in a Text-Based Game for Language Models Aidan O'Gara Published: 2023-07-05Area: Deception & FailureCitations: 51 Tags: ai-safety, deception-failure, empirical | 2023-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 51 |