Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Fine-Tuning Is All You Need to Mitigate Backdoor Attacks Mathias Humbert, Pascal Berrang, Xinlei He, Yang Zhang Published: 2022-12-18Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2022-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 49 |
| Can Large Language Models Change User Preference Adversarially? Varshini Subhash Published: 2023-01-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-01-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 9 |
| Does Localization Inform Editing? Surprising Differences in Causality-Based Localization vs. Knowledge Editing in Language Models Asma Ghandeharioun, Been Kim, Mohit Bansal, Peter Hase Published: 2023-01-10Area: Model EditingCitations: 240 Tags: ai-safety, empirical, model-editing | 2023-01-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 240 |
| Progress Measures for Grokking via Mechanistic Interpretability Jacob Steinhardt, Jess Smith, Lawrence Chan, Neel Nanda Published: 2023-01-12Area: Training DynamicsCitations: 680 Tags: ai-safety, empirical, interpretability, training-dynamics | 2023-01-12 | Training Dynamics | ai-safety, empirical, interpretability, training-dynamics | E5 / R3 (95%) | 680 |
| A Watermark for Large Language Models Ian Miers, John Kirchenbauer, Jonas Geiping, Jonathan Katz Published: 2023-01-24Area: Safety EvaluationCitations: 777 Tags: ai-safety, empirical, safety-evaluation | 2023-01-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 777 |
| Transformer-Patcher: One Mistake worth One Neuron Jie Zhou, Wenge Rong, Xiaofeng Zhang, Yikang Shen Published: 2023-01-24Area: Model EditingCitations: 217 Tags: ai-safety, empirical, model-editing | 2023-01-24 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 217 |
| Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity Chunyang Chen, Terry Yue Zhuo, Yujin Huang, Zhenchang Xing Published: 2023-01-30Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R5 (96%) | 137 |
| A Toy Model of Universality: Reverse Engineering How Networks Learn Group Operations Bilal Chughtai, Lawrence Chan, Neel Nanda Published: 2023-02-06Area: Mechanistic Interp.Citations: 135 Tags: ai-safety, empirical, mechanistic-interp | 2023-02-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 135 |
| Adversarial Prompting for Black Box Foundation Models Eric Wong, Jacob Gardner, Natalie Maus, Patrick Chao Published: 2023-02-08Area: Adversarial RobustnessCitations: 77 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 77 |
| Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks Carlos Guestrin, Daniel Kang, Ion Stoica, Matei Zaharia Published: 2023-02-11Area: Adversarial RobustnessCitations: 345 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 345 |
| The Capacity for Moral Self-Correction in Large Language Models Amanda Askell, Anna Chen, Anna Goldie, Azalia Mirhoseini Published: 2023-02-15Area: Alignment TrainingCitations: 196 Tags: ai-safety, alignment-training, empirical | 2023-02-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 196 |
| Aligning Language Models with Preferences through f-divergence Minimization Dongyoung Go, Germ谩n Kruszewski, Jos Rozen, Marc Dymetman Published: 2023-02-16Area: Alignment TrainingCitations: 114 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 114 |
| Pretraining Language Models with Human Preferences Angelica Chen, Christopher L. Buckley, Ethan Perez, Jason Phang Published: 2023-02-16Area: Alignment TrainingCitations: 280 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 280 |
| Poisoning Web-Scale Training Datasets is Practical Andreas Terzis, Christopher A. Choquette-Choo, Daniel Paleka, Florian Tram猫r Published: 2023-02-20Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 284 |
| BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT Jiawen Shi, Lichao Sun, Pan Zhou, Yixin Liu Published: 2023-02-21Area: Adversarial RobustnessCitations: 102 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 102 |
| Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection Christoph Endres, Kai Greshake, Mario Fritz, Sahar Abdelnabi Published: 2023-02-23Area: Adversarial RobustnessCitations: 894 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 894 |
| Analyzing And Editing Inner Mechanisms of Backdoored Language Models Anka Reuel, Max Lamparth Published: 2023-02-24Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, empirical, mechanistic-interp | 2023-02-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (95%) | 15 |
| Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard Published: 2023-03-05Area: Mechanistic Interp.Citations: 147 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2023-03-05 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R2 (94%) | 147 |
| Automatically Auditing Large Language Models via Discrete Optimization Aditi Raghunathan, Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2023-03-08Area: Safety EvaluationCitations: 220 Tags: ai-safety, empirical, safety-evaluation | 2023-03-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 220 |
| Erasing Concepts from Diffusion Models David Bau, Jaden Fiotto-Kaufman, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-03-13Area: Model EditingCitations: 469 Tags: ai-safety, empirical, model-editing | 2023-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 469 |
| Eliciting Latent Predictions from Transformers with the Tuned Lens Danny Halawi, Igor Ostrovsky, Jacob Steinhardt, Lev McKinney Published: 2023-03-14Area: Representation AnalysisCitations: 344 Tags: ai-safety, empirical, representation-analysis | 2023-03-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 344 |
| Ablating Concepts in Text-to-Image Diffusion Models Bingliang Zhang, Eli Shechtman, Jun-Yan Zhu, Nupur Kumari Published: 2023-03-23Area: Model EditingCitations: 300 Tags: ai-safety, empirical, model-editing | 2023-03-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 300 |
| Inspecting and Editing Knowledge Representations in Language Models Belinda Z. Li, Evan Hernandez, Jacob Andreas Published: 2023-04-03Area: Model EditingCitations: 130 Tags: ai-safety, empirical, model-editing | 2023-04-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 130 |
| Multi-step Jailbreaking Privacy Attacks on ChatGPT Dadi Guo, Fanpu Meng, Haoran Li, Jie Huang Published: 2023-04-11Area: Adversarial RobustnessCitations: 462 Tags: adversarial-robustness, ai-safety, empirical | 2023-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 462 |
| RRHF: Rank Responses to Align Language Models with Human Feedback without tears Chuanqi Tan, Fei Huang, Hongyi Yuan, Songfang Huang Published: 2023-04-11Area: Alignment TrainingCitations: 489 Tags: ai-safety, alignment-training, empirical | 2023-04-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 489 |
| Toxicity in ChatGPT: Analyzing Persona-assigned Language Models Ameet Deshpande, Ashwin Kalyan, Karthik Narasimhan, Tanmay Rajpurohit Published: 2023-04-11Area: Safety EvaluationCitations: 469 Tags: ai-safety, empirical, safety-evaluation | 2023-04-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (92%) | 469 |
| Localizing Model Behavior with Path Patching Aryaman Arora, Chris MacLeod, Lucas Sato, Nicholas Goldowsky-Dill Published: 2023-04-12Area: Mechanistic Interp.Citations: 130 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 130 |
| RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment Deepanshu Goyal, Hanze Dong, Jipeng Zhang, Kashun Shum Published: 2023-04-13Area: Alignment TrainingCitations: 666 Tags: ai-safety, alignment-training, empirical | 2023-04-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 666 |
| Disentangling Neuron Representations with Concept Vectors Henning Muller, Laura O'Mahony, Mara Graziani, Vincent Andrearczyk Published: 2023-04-19Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Censoring chemical data to mitigate dual use risk Andrew D. White, Jonathan Herington, Quintina L. Campbell Published: 2023-04-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, empirical, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 8 |