Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Review of the Evidence for Existential Risk from AI via Misaligned Power-Seeking Rose Hadshar Published: 2023-10-27Area: Surveys & ReviewsCitations: 11 Tags: ai-safety, survey, surveys-reviews | 2023-10-27 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E6 / R3 (92%) | 11 |
| Personas as a Way to Model Truthfulness in Language Models Abulhair Saparov, He He, Javier Rando, Najoung Kim Published: 2023-10-27Area: Deception & FailureCitations: 41 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 41 |
| Preventing Language Models From Hiding Their Reasoning Fabien Roger, Ryan Greenblatt Published: 2023-10-27Area: Deception & FailureCitations: 30 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (95%) | 30 |
| Adversarial Attacks and Defenses in Large Language Models: Old and New Threats David Dobre, Gauthier Gidel, Leo Schwinn, Stephan G眉nnemann Published: 2023-10-30Area: Adversarial RobustnessCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 64 |
| AI Alignment: A Comprehensive Survey Aidan O'Gara, Borong Zhang, Boyuan Chen, Brian Tse Published: 2023-10-30Area: Surveys & ReviewsCitations: 320 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2023-10-30 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E7 / R4 (97%) | 320 |
| BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B Charlie Rogers-Smith, Jeffrey Ladish, Pranav Gade, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 35 |
| DEPN: Detecting and Editing Privacy Neurons in Pretrained Language Models Chao Bian, Deyi Xiong, Junzhuo Li, Minghui Xu Published: 2023-10-31Area: Model EditingCitations: 85 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (96%) | 85 |
| LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B Charlie Rogers-Smith, Jeffrey Ladish, Simon Lermen Published: 2023-10-31Area: Adversarial RobustnessCitations: 152 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 152 |
| The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback Nathan Lambert, Roberto Calandra Published: 2023-10-31Area: Alignment TrainingCitations: 42 Tags: ai-safety, alignment-training, safety-evaluation, theoretical | 2023-10-31 | Alignment Training | ai-safety, alignment-training, safety-evaluation, theoretical | E5 / R3 (95%) | 42 |
| Unlearn What You Want to Forget: Efficient Unlearning for LLMs Diyi Yang, Jiaao Chen Published: 2023-10-31Area: Model EditingCitations: 231 Tags: ai-safety, empirical, model-editing | 2023-10-31 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 231 |
| Comparing Optimization Targets for Contrast-Consistent Search Hugo Fry, Ian Fan, Jamie Wright, Nandi Schoots Published: 2023-11-01Area: Representation AnalysisCitations: 4 Tags: ai-safety, empirical, representation-analysis | 2023-11-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (94%) | 4 |
| Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game Alan Ritter, Ethan Mendes, Isaac Ong, Justin Svegliato Published: 2023-11-02Area: Adversarial RobustnessCitations: 108 Tags: adversarial-robustness, ai-safety, dataset | 2023-11-02 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E6 / R3 (97%) | 108 |
| Can LLMs Follow Simple Rules? Dan Hendrycks, David Karamardian, David Wagner, Lulwa Aljeraisy Published: 2023-11-06Area: Safety EvaluationCitations: 45 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-11-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 45 |
| DeepInception: Hypnotize Large Language Model to Be Jailbreaker Bo Han, Jiangchao Yao, Jianing Zhu, Tongliang Liu Published: 2023-11-06Area: Adversarial RobustnessCitations: 308 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 308 |
| Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation Arush Tagade, Javier Rando, Quentin Feuillade-Montixi, Rusheb Shah Published: 2023-11-06Area: Adversarial RobustnessCitations: 199 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 199 |
| The Linear Representation Hypothesis and the Geometry of Large Language Models Kiho Park, Victor Veitch, Yo Joong Choe Published: 2023-11-07Area: Representation AnalysisCitations: 371 Tags: ai-safety, representation-analysis, theoretical | 2023-11-07 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (95%) | 371 |
| Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models Fazl Barez, Michael Lan Published: 2023-11-07Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | 9 |
| Uncovering Intermediate Variables in Transformers using Circuit Probing Ellie Pavlick, Michael A. Lepori, Thomas Serre Published: 2023-11-07Area: Mechanistic Interp.Citations: 12 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 12 |
| Frontier Language Models are not Robust to Adversarial Arithmetic, or 'What do I need to say so you agree 2+2=5?' Aaron Parisi, Alex Alemi, Alex Rizkowsky, Azade Nova Published: 2023-11-08Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 2 |
| Future Lens: Anticipating Subsequent Tokens from a Single Hidden State Andrew Yuan, Byron C. Wallace, David Bau, Jiuding Sun Published: 2023-11-08Area: Mechanistic Interp.Citations: 97 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-08 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (96%) | 97 |
| FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts Anyu Wang, Conglei Wang, Delong Ran, Jinyuan Liu Published: 2023-11-09Area: Multimodal SafetyCitations: 306 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2023-11-09 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | 306 |
| Large Language Models can Strategically Deceive their Users when Put Under Pressure J茅r茅my Scheurer, Marius Hobbhahn, Mikita Balesni Published: 2023-11-09Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 101 |
| Removing RLHF Protections in GPT-4 via Fine-Tuning Akul Gupta, Daniel Kang, Qiusi Zhan, Richard Fang Published: 2023-11-09Area: Adversarial RobustnessCitations: 150 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 150 |
| Generalization Analogies: A Testbed for Generalizing AI Oversight to Hard-To-Measure Domains Garrett Baker, Joshua Clymer, Rohan Subramani, Sam Wang Published: 2023-11-13Area: Scalable OversightCitations: 8 Tags: ai-safety, benchmark, scalable-oversight | 2023-11-13 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E7 / R3 (94%) | 8 |
| Alignment is not sufficient to prevent large language models from generating harmful information: A psychoanalytic perspective Jia Liu, Wei Ding, Zi Yin Published: 2023-11-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3 |
| Scheming AIs: Will AIs Fake Alignment During Training in Order to Get Power? Joe Carlsmith Published: 2023-11-14Area: Deception & FailureCitations: 59 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-11-14 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (94%) | 59 |
| SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models Anand Kannappan, Bertie Vidgen, Hannah Rose Kirk, Nino Scherrer Published: 2023-11-14Area: Safety EvaluationCitations: 50 Tags: ai-safety, benchmark, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 50 |
| Towards Evaluating AI Systems for Moral Status Using Self-Reports Ethan Perez, Robert Long Published: 2023-11-14Area: Safety EvaluationCitations: 17 Tags: ai-safety, position, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R4 (93%) | 17 |
| Backdoor Activation Attack: Attack Large Language Models using Activation Steering for Safety-Alignment Haoran Wang, Kai Shu Published: 2023-11-15Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 24 |
| Debate Helps Supervise Unreliable Experts David Rein, Jackson Petty, Julian Michael, Julien Dirani Published: 2023-11-15Area: Scalable OversightCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2023-11-15 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 31 |