Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Toxicity in ChatGPT: Analyzing Persona-assigned Language Models Ameet Deshpande, Ashwin Kalyan, Karthik Narasimhan, Tanmay Rajpurohit Published: 2023-04-11Area: Safety EvaluationCitations: 469 Tags: ai-safety, empirical, safety-evaluation | 2023-04-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (92%) | 469 |
| Censoring chemical data to mitigate dual use risk Andrew D. White, Jonathan Herington, Quintina L. Campbell Published: 2023-04-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, empirical, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 8 |
| Safety Assessment of Chinese Large Language Models Hao Sun, Jiale Cheng, Jiawen Deng, Minlie Huang Published: 2023-04-20Area: Safety EvaluationCitations: 103 Tags: ai-safety, benchmark, safety-evaluation | 2023-04-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 103 |
| Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting Ethan Perez, Julian Michael, Miles Turpin, Samuel R. Bowman Published: 2023-05-07Area: Safety EvaluationCitations: 832 Tags: ai-safety, empirical, safety-evaluation | 2023-05-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 832 |
| Spear Phishing With Large Language Models Julian Hazell Published: 2023-05-11Area: Safety EvaluationCitations: 72 Tags: ai-safety, empirical, safety-evaluation | 2023-05-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 72 |
| Adversarial Nibbler: A Data-Centric Challenge for Improving the Safety of Text-to-Image Models Addison Howard, Alicia Parrish, Charvi Rastogi, D. Sculley Published: 2023-05-22Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 12 |
| How Language Model Hallucinations Can Snowball Alisa Liu, Muru Zhang, Noah A. Smith, Ofir Press Published: 2023-05-22Area: Safety EvaluationCitations: 381 Tags: ai-safety, empirical, safety-evaluation | 2023-05-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 381 |
| Model Evaluation for Extreme Risks Allan Dafoe, Been Kim, Ben Garfinkel, Daniel Kokotajlo Published: 2023-05-24Area: Safety EvaluationCitations: 201 Tags: ai-safety, alignment-training, position, safety-evaluation | 2023-05-24 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E5 / R4 (93%) | 201 |
| Training Data Extraction From Pre-trained Language Models: A Survey Shotaro Ishihara Published: 2023-05-25Area: Safety EvaluationCitations: 57 Tags: ai-safety, safety-evaluation, survey | 2023-05-25 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (94%) | 57 |
| Query-Efficient Black-Box Red Teaming via Bayesian Optimization Deokjae Lee, Hwaran Lee, Hyun Oh Song, Jin-Hwa Kim Published: 2023-05-27Area: Safety EvaluationCitations: 31 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-05-27 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 31 |
| Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena Dacheng Li, Eric P. Xing, Hao Zhang, Ion Stoica Published: 2023-06-09Area: Safety EvaluationCitations: 7108 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 7108 |
| Explore, Establish, Exploit: Red Teaming Language Models from Scratch Dylan Hadfield-Menell, Gatlen Culp, Jason Lin, Joe Kwon Published: 2023-06-15Area: Safety EvaluationCitations: 125 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 125 |
| Inverse Scaling: When Bigger Isn't Better Aaron Mueller, Alexander Lyzhov, Alicia Parrish, Ameya Prabhu Published: 2023-06-15Area: Safety EvaluationCitations: 189 Tags: ai-safety, benchmark, safety-evaluation | 2023-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 189 |
| DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Bo Li, Boxin Wang, Chejian Xu, Chenhui Zhang Published: 2023-06-20Area: Safety EvaluationCitations: 575 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-06-20 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 575 |
| Evaluating Shutdown Avoidance of Language Models in Textual Scenarios Leon Lang, Simon Lermen, Teun van der Weij Published: 2023-07-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2023-07-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 7 |
| Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations Chen Zhao, He He, Jacob Steinhardt, Kathleen McKeown Published: 2023-07-17Area: Safety EvaluationCitations: 82 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 82 |
| Measuring Faithfulness in Chain-of-Thought Reasoning Anna Chen, Ansh Radhakrishnan, Benoit Steiner, Carson Denison Published: 2023-07-17Area: Safety EvaluationCitations: 336 Tags: ai-safety, empirical, safety-evaluation | 2023-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 336 |
| CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility Chao Peng, Fei Huang, Guohai Xu, Haotian Xu Published: 2023-07-19Area: Safety EvaluationCitations: 99 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2023-07-19 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 99 |
| FACADE: A Framework for Adversarial Circuit Anomaly Detection and Evaluation Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Mechanistic Interp.Citations: 2 Tags: adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | 2023-07-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | E5 / R3 (94%) | 2 |
| XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models Bertie Vidgen, Dirk Hovy, Federico Bianchi, Giuseppe Attanasio Published: 2023-08-02Area: Safety EvaluationCitations: 283 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 283 |
| FLIRT: Feedback Loop In-context Red Teaming Aram Galstyan, Christophe Dupuy, Kai-Wei Chang, Ninareh Mehrabi Published: 2023-08-08Area: Safety EvaluationCitations: 93 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-08-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 93 |
| EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models Bozhong Tian, Guozhou Zheng, Huajun Chen, Kangwei Liu Published: 2023-08-14Area: Model EditingCitations: 86 Tags: ai-safety, model-editing, safety-evaluation, tool | 2023-08-14 | Model Editing | ai-safety, model-editing, safety-evaluation, tool | E6 / R4 (97%) | 86 |
| Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment Rishabh Bhardwaj, Soujanya Poria Published: 2023-08-18Area: Safety EvaluationCitations: 229 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2023-08-18 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 229 |
| Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities Bennett Kleinberg, Lewis D. Griffin, Maximilian Mozes, Xuanli He Published: 2023-08-24Area: Safety EvaluationCitations: 113 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | 2023-08-24 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | E5 / R4 (95%) | 113 |
| Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs Haonan Li, Preslav Nakov, Timothy Baldwin, Xudong Han Published: 2023-08-25Area: Safety EvaluationCitations: 158 Tags: ai-safety, dataset, safety-evaluation | 2023-08-25 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 158 |
| Benchmarks for Detecting Measurement Tampering Buck Shlegeris, Fabien Roger, Max Nadeau, Nate Thomas Published: 2023-08-29Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 4 |
| Taken out of Context: On Measuring Situational Awareness in LLMs Asa Cooper Stickland, Daniel Kokotajlo, Lukas Berglund, Max Kaufmann Published: 2023-09-01Area: Safety EvaluationCitations: 107 Tags: ai-safety, empirical, safety-evaluation | 2023-09-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 107 |
| Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu Published: 2023-09-12Area: Safety EvaluationCitations: 137 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 137 |
| RAIN: Your Language Models Can Align Themselves without Finetuning Chao Zhang, Fangyun Wei, Hongyang Zhang, Jinjing Zhao Published: 2023-09-13Area: Alignment TrainingCitations: 161 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-09-13 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 161 |
| SafetyBench: Evaluating the Safety of Large Language Models Chong Long, Jie Tang, Leqi Lei, Lindong Wu Published: 2023-09-13Area: Safety EvaluationCitations: 182 Tags: ai-safety, benchmark, safety-evaluation | 2023-09-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 182 |