Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Linear Representations of Sentiment in Large Language Models Atticus Geiger, Curt Tigges, Neel Nanda, Oskar John Hollinsworth Published: 2023-10-23Area: Representation AnalysisCitations: 131 Tags: ai-safety, empirical, representation-analysis | 2023-10-23 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (95%) | 131 |
| Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition Anaum Khan, Anson Liu Kost, Chenglei Si, Christopher Carnahan Published: 2023-10-24Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 66 |
| In-Context Learning Creates Task Vectors Amir Globerson, Mor Geva, Roee Hendel Published: 2023-10-24Area: Mechanistic Interp.Citations: 258 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 258 |
| Multi-scale Diffusion Denoised Smoothing Jinwoo Shin, Jongheon Jeong Published: 2023-10-25Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 14 |
| SuperHF: Supervised Iterative Learning from Human Feedback Gabriel Mukobi, Gitta Kutyniok, Kush Bhatia, Oliver Fong Published: 2023-10-25Area: Alignment TrainingCitations: 13 Tags: ai-safety, alignment-training, empirical | 2023-10-25 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 13 |
| Zephyr: Direct Distillation of LM Alignment Alexander M. Rush, Cl茅mentine Fourrier, Edward Beeching, Kashif Rasul Published: 2023-10-25Area: Alignment TrainingCitations: 542 Tags: ai-safety, alignment-training, empirical | 2023-10-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 542 |
| Codebook Features: Sparse and Discrete Interpretability for Neural Networks Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman Published: 2023-10-26Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-10-26 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 41 |
| How Do Language Models Bind Entities in Context? Jacob Steinhardt, Jiahai Feng Published: 2023-10-26Area: Mechanistic Interp.Citations: 70 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 70 |
| Personas as a Way to Model Truthfulness in Language Models Abulhair Saparov, He He, Javier Rando, Najoung Kim Published: 2023-10-27Area: Deception & FailureCitations: 41 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 41 |
| Preventing Language Models From Hiding Their Reasoning Fabien Roger, Ryan Greenblatt Published: 2023-10-27Area: Deception & FailureCitations: 30 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (95%) | 30 |
| Adversarial Attacks and Defenses in Large Language Models: Old and New Threats David Dobre, Gauthier Gidel, Leo Schwinn, Stephan G眉nnemann Published: 2023-10-30Area: Adversarial RobustnessCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 64 |
| BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B Charlie Rogers-Smith, Jeffrey Ladish, Pranav Gade, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 35 |
| DEPN: Detecting and Editing Privacy Neurons in Pretrained Language Models Chao Bian, Deyi Xiong, Junzhuo Li, Minghui Xu Published: 2023-10-31Area: Model EditingCitations: 85 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (96%) | 85 |
| LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B Charlie Rogers-Smith, Jeffrey Ladish, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 152 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 152 |
| Unlearn What You Want to Forget: Efficient Unlearning for LLMs Diyi Yang, Jiaao Chen Published: 2023-10-31Area: Model EditingCitations: 231 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 231 |
| Comparing Optimization Targets for Contrast-Consistent Search Hugo Fry, Ian Fan, Jamie Wright, Nandi Schoots Published: 2023-11-01Area: Representation AnalysisCitations: 4 Tags: ai-safety, empirical, representation-analysis | 2023-11-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (94%) | 4 |
| DeepInception: Hypnotize Large Language Model to Be Jailbreaker Bo Han, Jiangchao Yao, Jianing Zhu, Tongliang Liu Published: 2023-11-06Area: Adversarial RobustnessCitations: 308 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 308 |
| Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation Arush Tagade, Javier Rando, Quentin Feuillade-Montixi, Rusheb Shah Published: 2023-11-06Area: Adversarial RobustnessCitations: 199 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 199 |
| Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models Fazl Barez, Michael Lan Published: 2023-11-07Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | 9 |
| Uncovering Intermediate Variables in Transformers using Circuit Probing Ellie Pavlick, Michael A. Lepori, Thomas Serre Published: 2023-11-07Area: Mechanistic Interp.Citations: 12 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 12 |
| Frontier Language Models are not Robust to Adversarial Arithmetic, or 'What do I need to say so you agree 2+2=5?' Aaron Parisi, Alex Alemi, Alex Rizkowsky, Azade Nova Published: 2023-11-08Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 2 |
| Future Lens: Anticipating Subsequent Tokens from a Single Hidden State Andrew Yuan, Byron C. Wallace, David Bau, Jiuding Sun Published: 2023-11-08Area: Mechanistic Interp.Citations: 97 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-08 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (96%) | 97 |
| FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts Anyu Wang, Conglei Wang, Delong Ran, Jinyuan Liu Published: 2023-11-09Area: Multimodal SafetyCitations: 306 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2023-11-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | 306 |
| Large Language Models can Strategically Deceive their Users when Put Under Pressure J茅r茅my Scheurer, Marius Hobbhahn, Mikita Balesni Published: 2023-11-09Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 101 |
| Removing RLHF Protections in GPT-4 via Fine-Tuning Akul Gupta, Daniel Kang, Qiusi Zhan, Richard Fang Published: 2023-11-09Area: Adversarial RobustnessCitations: 150 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 150 |
| Alignment is not sufficient to prevent large language models from generating harmful information: A psychoanalytic perspective Jia Liu, Wei Ding, Zi Yin Published: 2023-11-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3 |
| Backdoor Activation Attack: Attack Large Language Models using Activation Steering for Safety-Alignment Haoran Wang, Kai Shu Published: 2023-11-15Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 24 |
| Debate Helps Supervise Unreliable Experts David Rein, Jackson Petty, Julian Michael, Julien Dirani Published: 2023-11-15Area: Scalable OversightCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2023-11-15 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 31 |
| Identifying Linear Relational Concepts in Large Language Models Anthony Hunter, David Chanin, Oana-Maria Camburu Published: 2023-11-15Area: Representation AnalysisCitations: 8 Tags: ai-safety, empirical, representation-analysis | 2023-11-15 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 8 |
| Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts Lichao Sun, Pan Zhou, Xiang Li, Yixin Liu Published: 2023-11-15Area: Multimodal SafetyCitations: 78 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-11-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | 78 |