Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AI Safety Subproblems for Software Engineering Researchers David Gros, Prem Devanbu, Zhou Yu Published: 2023-04-28Area: Surveys & ReviewsCitations: 4 Tags: ai-safety, survey, surveys-reviews | 2023-04-28 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (94%) | 4 |
| Are Emergent Abilities of Large Language Models a Mirage? Brando Miranda, Rylan Schaeffer, Sanmi Koyejo Published: 2023-04-28Area: Training DynamicsCitations: 591 Tags: ai-safety, empirical, training-dynamics | 2023-04-28 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 591 |
| Dissecting Recall of Factual Associations in Auto-Regressive Language Models Amir Globerson, Jasmijn Bastings, Katja Filippova, Mor Geva Published: 2023-04-28Area: Mechanistic Interp.Citations: 440 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 440 |
| Towards Automated Circuit Discovery for Mechanistic Interpretability Adria Garriga-Alonso, Aengus Lynch, Arthur Conmy, Augustine N. Mavor-Parker Published: 2023-04-28Area: Mechanistic Interp.Citations: 485 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-04-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 485 |
| How does GPT-2 Compute Greater-Than?: Interpreting Mathematical Abilities in a Pre-trained Language Model Alexandre Variengien, Michael Hanna, Ollie Liu Published: 2023-04-30Area: Mechanistic Interp.Citations: 190 Tags: ai-safety, empirical, mechanistic-interp | 2023-04-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 190 |
| Poisoning Language Models During Instruction Tuning Alexander Wan, Dan Klein, Eric Wallace, Sheng Shen Published: 2023-05-01Area: Adversarial RobustnessCitations: 290 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 290 |
| Finding Neurons in a Haystack: Case Studies with Sparse Probing Dimitris Bertsimas, Dmitrii Troitskii, Katherine Harvey, Matthew Pauly Published: 2023-05-02Area: Representation AnalysisCitations: 302 Tags: ai-safety, empirical, representation-analysis | 2023-05-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 302 |
| Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision Chuang Gan, David Cox, Hongxin Zhang, Qinhong Zhou Published: 2023-05-04Area: Alignment TrainingCitations: 410 Tags: ai-safety, alignment-training, empirical | 2023-05-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 410 |
| Seeing is Believing: Brain-Inspired Modular Training for Mechanistic Interpretability Eric Gan, Max Tegmark, Ziming Liu Published: 2023-05-04Area: Mechanistic Interp.Citations: 52 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-05-04 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 52 |
| A Technical Note on Bilinear Layers for Interpretability Lee Sharkey Published: 2023-05-05Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2023-05-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (92%) | 10 |
| Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting Ethan Perez, Julian Michael, Miles Turpin, Samuel R. Bowman Published: 2023-05-07Area: Safety EvaluationCitations: 832 Tags: ai-safety, empirical, safety-evaluation | 2023-05-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 832 |
| KGA: A General Machine Unlearning Framework Based on Knowledge Gap Alignment Hongzhi Yin, Kam-Fai Wong, Lingzhi Wang, Tong Chen Published: 2023-05-11Area: Model EditingCitations: 100 Tags: ai-safety, alignment-training, empirical, model-editing | 2023-05-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E7 / R4 (96%) | 100 |
| Spear Phishing With Large Language Models Julian Hazell Published: 2023-05-11Area: Safety EvaluationCitations: 72 Tags: ai-safety, empirical, safety-evaluation | 2023-05-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 72 |
| Interpretability at Scale: Identifying Causal Mechanisms in Alpaca Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard Published: 2023-05-15Area: Mechanistic Interp.Citations: 113 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2023-05-15 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 113 |
| Explaining Black Box Text Modules in Natural Language with Language Models Alexander G. Huth, Aliyah R. Hsu, Bin Yu, Chandan Singh Published: 2023-05-17Area: Mechanistic Interp.Citations: 66 Tags: ai-safety, empirical, mechanistic-interp | 2023-05-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 66 |
| SLiC-HF: Sequence Likelihood Calibration with Human Feedback Misha Khalman, Mohammad Saleh, Peter J. Liu, Rishabh Joshi Published: 2023-05-17Area: Alignment TrainingCitations: 384 Tags: ai-safety, alignment-training, empirical | 2023-05-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 384 |
| Data Redaction from Conditional Generative Models Kamalika Chaudhuri, Zhifeng Kong Published: 2023-05-18Area: Model EditingCitations: 9 Tags: ai-safety, empirical, model-editing | 2023-05-18 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 9 |
| SneakyPrompt: Jailbreaking Text-to-Image Generative Models Bo Hui, Haolin Yuan, Neil Gong, Yinzhi Cao Published: 2023-05-20Area: Adversarial RobustnessCitations: 165 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 165 |
| Adversarial Nibbler: A Data-Centric Challenge for Improving the Safety of Text-to-Image Models Addison Howard, Alicia Parrish, Charvi Rastogi, D. Sculley Published: 2023-05-22Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 12 |
| AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback Carlos Guestrin, Ishaan Gulrajani, Jimmy Ba, Percy Liang Published: 2023-05-22Area: Alignment TrainingCitations: 797 Tags: ai-safety, alignment-training, tool | 2023-05-22 | Alignment Training | ai-safety, alignment-training, tool | E5 / R3 (96%) | 797 |
| Can We Edit Factual Knowledge by In-Context Learning? Baobao Chang, Ce Zheng, Jingjing Xu, Lei Li Published: 2023-05-22Area: Model EditingCitations: 299 Tags: ai-safety, empirical, model-editing | 2023-05-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 299 |
| Editing Large Language Models: Problems, Methods, and Opportunities Bozhong Tian, Huajun Chen, Ningyu Zhang, Peng Wang Published: 2023-05-22Area: Model EditingCitations: 417 Tags: ai-safety, model-editing, survey | 2023-05-22 | Model Editing | ai-safety, model-editing, survey | E8 / R3 (97%) | 417 |
| How Language Model Hallucinations Can Snowball Alisa Liu, Muru Zhang, Noah A. Smith, Ofir Press Published: 2023-05-22Area: Safety EvaluationCitations: 381 Tags: ai-safety, empirical, safety-evaluation | 2023-05-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 381 |
| Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study Gelei Deng, Kailong Wang, Lida Zhao, Tianwei Zhang Published: 2023-05-23Area: Adversarial RobustnessCitations: 636 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 636 |
| Adversarial Demonstration Attacks on Large Language Models Chaowei Xiao, Jiongxiao Wang, Keun Hee Park, Muhao Chen Published: 2023-05-24Area: Adversarial RobustnessCitations: 71 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 71 |
| A Mechanistic Interpretation of Arithmetic Reasoning in Language Models using Causal Mediation Analysis Alessandro Stolfo, Mrinmaya Sachan, Yonatan Belinkov Published: 2023-05-24Area: Mechanistic Interp.Citations: 71 Tags: ai-safety, empirical, mechanistic-interp | 2023-05-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 71 |
| Model Evaluation for Extreme Risks Allan Dafoe, Been Kim, Ben Garfinkel, Daniel Kokotajlo Published: 2023-05-24Area: Safety EvaluationCitations: 201 Tags: ai-safety, alignment-training, position, safety-evaluation | 2023-05-24 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E5 / R4 (93%) | 201 |
| MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions Christopher D. Manning, Christopher Potts, Danqi Chen, Zexuan Zhong Published: 2023-05-24Area: Model EditingCitations: 288 Tags: ai-safety, benchmark, model-editing | 2023-05-24 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 288 |
| Tricking LLMs into Disobedience: Understanding, Analyzing, and Preventing Jailbreaks Abhinav Rao, Atharva Naik, Monojit Choudhury, Sachin Vashistha Published: 2023-05-24Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical | 2023-05-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 46 |
| Language Models Implement Simple Word2Vec-style Vector Arithmetic Carsten Eickhoff, Ellie Pavlick, Jack Merullo Published: 2023-05-25Area: Mechanistic Interp.Citations: 86 Tags: ai-safety, empirical, mechanistic-interp | 2023-05-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 86 |