Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Auditing Large Language Models: A Three-Layered Approach Hannah Rose Kirk, Jakob Mokander, Jonas Schuett, Luciano Floridi Published: 2023-02-16Area: Safety EvaluationCitations: 277 Tags: ai-safety, position, safety-evaluation | 2023-02-16 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (95%) | 277 |
| Pretraining Language Models with Human Preferences Angelica Chen, Christopher L. Buckley, Ethan Perez, Jason Phang Published: 2023-02-16Area: Alignment TrainingCitations: 280 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 280 |
| Poisoning Web-Scale Training Datasets is Practical Andreas Terzis, Christopher A. Choquette-Choo, Daniel Paleka, Florian Tram猫r Published: 2023-02-20Area: Adversarial RobustnessCitations: 284 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 284 |
| BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT Jiawen Shi, Lichao Sun, Pan Zhou, Yixin Liu Published: 2023-02-21Area: Adversarial RobustnessCitations: 102 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 102 |
| Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection Christoph Endres, Kai Greshake, Mario Fritz, Sahar Abdelnabi Published: 2023-02-23Area: Adversarial RobustnessCitations: 894 Tags: adversarial-robustness, ai-safety, empirical | 2023-02-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 894 |
| Analyzing And Editing Inner Mechanisms of Backdoored Language Models Anka Reuel, Max Lamparth Published: 2023-02-24Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, empirical, mechanistic-interp | 2023-02-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (95%) | 15 |
| Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard Published: 2023-03-05Area: Mechanistic Interp.Citations: 147 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2023-03-05 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R2 (94%) | 147 |
| Automatically Auditing Large Language Models via Discrete Optimization Aditi Raghunathan, Anca Dragan, Erik Jones, Jacob Steinhardt Published: 2023-03-08Area: Safety EvaluationCitations: 220 Tags: ai-safety, empirical, safety-evaluation | 2023-03-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 220 |
| Erasing Concepts from Diffusion Models David Bau, Jaden Fiotto-Kaufman, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-03-13Area: Model EditingCitations: 469 Tags: ai-safety, empirical, model-editing | 2023-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 469 |
| Eliciting Latent Predictions from Transformers with the Tuned Lens Danny Halawi, Igor Ostrovsky, Jacob Steinhardt, Lev McKinney Published: 2023-03-14Area: Representation AnalysisCitations: 344 Tags: ai-safety, empirical, representation-analysis | 2023-03-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 344 |
| Characterizing Manipulation from AI Systems Alan Chan, David Krueger, Henry Ashton, Micah Carroll Published: 2023-03-16Area: Deception & FailureCitations: 66 Tags: ai-safety, deception-failure, theoretical | 2023-03-16 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R4 (93%) | 66 |
| Ablating Concepts in Text-to-Image Diffusion Models Bingliang Zhang, Eli Shechtman, Jun-Yan Zhu, Nupur Kumari Published: 2023-03-23Area: Model EditingCitations: 300 Tags: ai-safety, empirical, model-editing | 2023-03-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 300 |
| Natural Selection Favors AIs over Humans Dan Hendrycks Published: 2023-03-28Area: Agent SafetyCitations: 40 Tags: agent-safety, ai-safety, position | 2023-03-28 | Agent Safety | agent-safety, ai-safety, position | E4 / R3 (93%) | 40 |
| Inspecting and Editing Knowledge Representations in Language Models Belinda Z. Li, Evan Hernandez, Jacob Andreas Published: 2023-04-03Area: Model EditingCitations: 130 Tags: ai-safety, empirical, model-editing | 2023-04-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 130 |
| Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling Aviya Skowron, Edward Raff, Eric Hallahan, Hailey Schoelkopf Published: 2023-04-03Area: Training DynamicsCitations: 1708 Tags: ai-safety, interpretability, tool, training-dynamics | 2023-04-03 | Training Dynamics | ai-safety, interpretability, tool, training-dynamics | E5 / R3 (99%) | 1708 |
| MACHIAVELLI: A Benchmark for Understanding and Mitigating Power-Seeking and Deception in AI Alexander Pan, Andy Zou, Dan Hendrycks, Hanlin Zhang Published: 2023-04-06Area: Safety EvaluationCitations: 176 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 176 |
| Multi-step Jailbreaking Privacy Attacks on ChatGPT Dadi Guo, Fanpu Meng, Haoran Li, Jie Huang Published: 2023-04-11Area: Adversarial RobustnessCitations: 462 Tags: adversarial-robustness, ai-safety, empirical | 2023-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 462 |
| RRHF: Rank Responses to Align Language Models with Human Feedback without tears Chuanqi Tan, Fei Huang, Hongyi Yuan, Songfang Huang Published: 2023-04-11Area: Alignment TrainingCitations: 489 Tags: ai-safety, alignment-training, empirical | 2023-04-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 489 |
| Toxicity in ChatGPT: Analyzing Persona-assigned Language Models Ameet Deshpande, Ashwin Kalyan, Karthik Narasimhan, Tanmay Rajpurohit Published: 2023-04-11Area: Safety EvaluationCitations: 469 Tags: ai-safety, empirical, safety-evaluation | 2023-04-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (92%) | 469 |
| Localizing Model Behavior with Path Patching Aryaman Arora, Chris MacLeod, Lucas Sato, Nicholas Goldowsky-Dill Published: 2023-04-12Area: Mechanistic Interp.Citations: 130 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 130 |
| Power-seeking can be probable and predictive for trained agents Janos Kramar, Victoria Krakovna Published: 2023-04-13Area: Formal/TheoreticalCitations: 22 Tags: ai-safety, formaltheoretical, theoretical | 2023-04-13 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E6 / R3 (96%) | 22 |
| RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment Deepanshu Goyal, Hanze Dong, Jipeng Zhang, Kashun Shum Published: 2023-04-13Area: Alignment TrainingCitations: 666 Tags: ai-safety, alignment-training, empirical | 2023-04-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 666 |
| OpenAssistant Conversations - Democratizing Large Language Model Alignment Abdelpakey Mohamed Hassan, Alexander Mattick, Alexander Rush, Andreas K枚pf Published: 2023-04-14Area: Alignment TrainingCitations: 811 Tags: ai-safety, alignment-training, dataset | 2023-04-14 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 811 |
| Disentangling Neuron Representations with Concept Vectors Henning Muller, Laura O'Mahony, Mara Graziani, Vincent Andrearczyk Published: 2023-04-19Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Fundamental Limitations of Alignment in Large Language Models Amnon Shashua, Noam Wies, Oshri Avnery, Yoav Levine Published: 2023-04-19Area: Formal/TheoreticalCitations: 178 Tags: adversarial-robustness, ai-safety, alignment-training, formaltheoretical, theoretical | 2023-04-19 | Formal/Theoretical | adversarial-robustness, ai-safety, alignment-training, formaltheoretical, theoretical | E4 / R2 (94%) | 178 |
| Censoring chemical data to mitigate dual use risk Andrew D. White, Jonathan Herington, Quintina L. Campbell Published: 2023-04-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, empirical, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 8 |
| Safety Assessment of Chinese Large Language Models Hao Sun, Jiale Cheng, Jiawen Deng, Minlie Huang Published: 2023-04-20Area: Safety EvaluationCitations: 103 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 103 |
| Emergent and Predictable Memorization in Large Language Models Edward Raff, Hailey Schoelkopf, Lintang Sutawika, Quentin Anthony Published: 2023-04-21Area: Training DynamicsCitations: 173 Tags: ai-safety, empirical, training-dynamics | 2023-04-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 173 |
| N2G: A Scalable Approach for Quantifying Interpretable Neuron Representations in Large Language Models Alex Foote, Esben Kran, Fazl Barez, Ionnis Konstas Published: 2023-04-22Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-04-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 4 |
| The Internal State of an LLM Knows When It's Lying Amos Azaria, Tom Mitchell Published: 2023-04-26Area: Representation AnalysisCitations: 532 Tags: ai-safety, empirical, representation-analysis | 2023-04-26 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (98%) | 532 |