Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Rigorously Assessing Natural Language Explanations of Neurons Atticus Geiger, Christopher Potts, Jing Huang, Karel D'Oosterlinck Published: 2023-09-19Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2023-09-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 41 |
| How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions Alexa Y. Pan, Alex J. Chan, Ilan Moscovitz, Jan Brauner Published: 2023-09-26Area: Safety EvaluationCitations: 80 Tags: ai-safety, empirical, safety-evaluation | 2023-09-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 80 |
| Large Language Model Alignment: A Survey Chuang Liu, Deyi Xiong, Renren Jin, Tianhao Shen Published: 2023-09-26Area: Surveys & ReviewsCitations: 292 Tags: adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | 2023-09-26 | Surveys & Reviews | adversarial-robustness, ai-safety, alignment-training, interpretability, safety-evaluation, survey, surveys-reviews | E6 / R4 (97%) | 292 |
| Deployment Corrections: An incident response framework for frontier AI models Joe O'Brien, Shaun Ee, Zoe Williams Published: 2023-09-30Area: Safety EvaluationCitations: 22 Tags: ai-safety, position, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (92%) | 22 |
| Red Teaming Game: A Game-Theoretic Framework for Red Teaming Language Models Chengdong Ma, Hai Ci, Jun Gao, Minquan Gao Published: 2023-09-30Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2023-09-30 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 13 |
| SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese Hang Xue, Kangkang Zhao, Lei Zhu, Liang Xu Published: 2023-10-09Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 22 |
| Sociotechnical Safety Evaluation of Generative AI Systems Arianna Manzini, Ben Bariach, Conor Griffin, Iason Gabriel Published: 2023-10-18Area: Safety EvaluationCitations: 190 Tags: ai-safety, safety-evaluation, survey | 2023-10-18 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R4 (96%) | 190 |
| The History and Risks of Reinforcement Learning and Human Feedback Nathan Lambert, Thomas Krendl Gilbert, Tom Zick Published: 2023-10-20Area: Alignment TrainingCitations: 50 Tags: ai-safety, alignment-training, safety-evaluation, survey | 2023-10-20 | Alignment Training | ai-safety, alignment-training, safety-evaluation, survey | E5 / R3 (96%) | 50 |
| Language Model Unalignment: Parametric Red-Teaming to Expose Hidden Harms and Biases Rishabh Bhardwaj, Soujanya Poria Published: 2023-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-10-22 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 23 |
| Adversarial Attacks and Defenses in Large Language Models: Old and New Threats David Dobre, Gauthier Gidel, Leo Schwinn, Stephan G眉nnemann Published: 2023-10-30Area: Adversarial RobustnessCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2023-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 64 |
| The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback Nathan Lambert, Roberto Calandra Published: 2023-10-31Area: Alignment TrainingCitations: 42 Tags: ai-safety, alignment-training, safety-evaluation, theoretical | 2023-10-31 | Alignment Training | ai-safety, alignment-training, safety-evaluation, theoretical | E5 / R3 (95%) | 42 |
| Can LLMs Follow Simple Rules? Dan Hendrycks, David Karamardian, David Wagner, Lulwa Aljeraisy Published: 2023-11-06Area: Safety EvaluationCitations: 45 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-11-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 45 |
| SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models Anand Kannappan, Bertie Vidgen, Hannah Rose Kirk, Nino Scherrer Published: 2023-11-14Area: Safety EvaluationCitations: 50 Tags: ai-safety, benchmark, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 50 |
| Towards Evaluating AI Systems for Moral Status Using Self-Reports Ethan Perez, Robert Long Published: 2023-11-14Area: Safety EvaluationCitations: 17 Tags: ai-safety, position, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R4 (93%) | 17 |
| How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities Boshi Wang, Huan Sun, Lingbo Mo, Muhao Chen Published: 2023-11-15Area: Safety EvaluationCitations: 44 Tags: ai-safety, benchmark, safety-evaluation | 2023-11-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 44 |
| Exploring the Robustness of Model-Graded Evaluations and Automated Interpretability Ondrej Kvapil, Simon Lermen Published: 2023-11-26Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, interpretability, safety-evaluation | 2023-11-26 | Safety Evaluation | ai-safety, empirical, interpretability, safety-evaluation | E5 / R3 (93%) | 3 |
| How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs Bingchen Zhao, Chenhang Cui, Cihang Xie, Haoqin Tu Published: 2023-11-27Area: Multimodal SafetyCitations: 108 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2023-11-27 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 108 |
| Knowledge Unlearning for LLMs: Tasks, Methods, and Challenges Dan Qu, Hao Zhang, Heyu Chang, Nianwen Si Published: 2023-11-27Area: Model EditingCitations: 41 Tags: ai-safety, model-editing, safety-evaluation, survey | 2023-11-27 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R5 (95%) | 41 |
| MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models Chao Yang, Jindong Gu, Xin Liu, Yichen Zhu Published: 2023-11-29Area: Multimodal SafetyCitations: 201 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2023-11-29 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 201 |
| Hashmarks: Privacy-Preserving Benchmarks for High-Stakes AI Evaluation Paul Bricman Published: 2023-12-01Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, theoretical | 2023-12-01 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (95%) | - |
| Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models Aleksandar Straumann, Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song Published: 2023-12-07Area: Safety EvaluationCitations: 123 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 123 |
| AI Control: Improving Safety Despite Intentional Subversion Buck Shlegeris, Fabien Roger, Kshitij Sachan, Ryan Greenblatt Published: 2023-12-12Area: Safety EvaluationCitations: 114 Tags: ai-safety, empirical, safety-evaluation | 2023-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 114 |
| Evaluating Language-Model Agents on Realistic Autonomous Tasks Aaron Ho, Brian Goodrich, Elizabeth Barnes, Haoxing Du Published: 2023-12-18Area: Safety EvaluationCitations: 101 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 101 |
| Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models Alan Chan, Ben Bucknall, David Krueger, Herbie Bradley Published: 2023-12-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, position, safety-evaluation | 2023-12-22 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 7 |
| TOFU: A Task of Fictitious Unlearning for LLMs Avi Schwarzschild, J. Zico Kolter, Pratyush Maini, Zachary C. Lipton Published: 2024-01-11Area: Safety EvaluationCitations: 351 Tags: ai-safety, benchmark, safety-evaluation | 2024-01-11 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 351 |
| AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models Beichen Wang, Chong Zhang, Dong Shu, Mingyu Jin Published: 2024-01-17Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-01-17 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 27 |
| PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety Feng Zhao, Hongzhi Gao, Huchuan Lu, Jing Shao Published: 2024-01-22Area: Agent SafetyCitations: 75 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2024-01-22 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E6 / R4 (95%) | 75 |
| Black-Box Access is Insufficient for Rigorous AI Audits Alan Chan, Andreas Haupt, Benjamin Bucknall, Carson Ezell Published: 2024-01-25Area: Safety EvaluationCitations: 143 Tags: ai-safety, position, safety-evaluation | 2024-01-25 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (95%) | 143 |
| Red-Teaming for Generative AI: Silver Bullet or Security Theater? Anusha Sinha, Hoda Heidari, Michael Feffer, Zachary C. Lipton Published: 2024-01-29Area: Safety EvaluationCitations: 126 Tags: ai-safety, safety-evaluation, survey | 2024-01-29 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 126 |
| HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Andy Zou, Bo Li, Dan Hendrycks, David Forsyth Published: 2024-02-06Area: Safety EvaluationCitations: 830 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-02-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (95%) | 830 |