Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese Hang Xue, Kangkang Zhao, Lei Zhu, Liang Xu Published: 2023-10-09Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 22 |
| Prompt Injection Attacks and Defenses in LLM-Integrated Applications Jinyuan Jia, Neil Zhenqiang Gong, Runpeng Geng, Yupei Liu Published: 2023-10-19Area: Adversarial RobustnessCitations: 236 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (93%) | 236 |
| Can LLMs Follow Simple Rules? Dan Hendrycks, David Karamardian, David Wagner, Lulwa Aljeraisy Published: 2023-11-06Area: Safety EvaluationCitations: 45 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2023-11-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 45 |
| Generalization Analogies: A Testbed for Generalizing AI Oversight to Hard-To-Measure Domains Garrett Baker, Joshua Clymer, Rohan Subramani, Sam Wang Published: 2023-11-13Area: Scalable OversightCitations: 8 Tags: ai-safety, benchmark, scalable-oversight | 2023-11-13 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E7 / R3 (94%) | 8 |
| SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models Anand Kannappan, Bertie Vidgen, Hannah Rose Kirk, Nino Scherrer Published: 2023-11-14Area: Safety EvaluationCitations: 50 Tags: ai-safety, benchmark, safety-evaluation | 2023-11-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 50 |
| Do Localization Methods Actually Localize Memorized Data in LLMs? A Tale of Two Benchmarks Jesse Thomason, Robin Jia, Ting-Yun Chang Published: 2023-11-15Area: Model EditingCitations: 26 Tags: ai-safety, benchmark, model-editing | 2023-11-15 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (93%) | 26 |
| How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities Boshi Wang, Huan Sun, Lingbo Mo, Muhao Chen Published: 2023-11-15Area: Safety EvaluationCitations: 44 Tags: ai-safety, benchmark, safety-evaluation | 2023-11-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 44 |
| GPQA: A Graduate-Level Google-Proof Q&A Benchmark Asa Cooper Stickland, Betty Li Hou, David Rein, Jackson Petty Published: 2023-11-20Area: Scalable OversightCitations: 2009 Tags: ai-safety, benchmark, scalable-oversight | 2023-11-20 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E6 / R4 (98%) | 2009 |
| DUnE: Dataset for Unified Editing Afra Feyza Aky眉rek, Derry Wijaya, Eric Pan, Garry Kuwanto Published: 2023-11-27Area: Model EditingCitations: 20 Tags: ai-safety, benchmark, model-editing | 2023-11-27 | Model Editing | ai-safety, benchmark, model-editing | E5 / R4 (95%) | 20 |
| How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs Bingchen Zhao, Chenhang Cui, Cihang Xie, Haoqin Tu Published: 2023-11-27Area: Multimodal SafetyCitations: 108 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2023-11-27 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 108 |
| MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models Chao Yang, Jindong Gu, Xin Liu, Yichen Zhu Published: 2023-11-29Area: Multimodal SafetyCitations: 201 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2023-11-29 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 201 |
| Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models Aleksandar Straumann, Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song Published: 2023-12-07Area: Safety EvaluationCitations: 123 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 123 |
| Evaluating Language-Model Agents on Realistic Autonomous Tasks Aaron Ho, Brian Goodrich, Elizabeth Barnes, Haoxing Du Published: 2023-12-18Area: Safety EvaluationCitations: 101 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 101 |
| Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models Bin Zhu, Emre Kiciman, Fangzhao Wu, Guangzhong Sun Published: 2023-12-21Area: Adversarial RobustnessCitations: 172 Tags: adversarial-robustness, ai-safety, benchmark | 2023-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 172 |
| TOFU: A Task of Fictitious Unlearning for LLMs Avi Schwarzschild, J. Zico Kolter, Pratyush Maini, Zachary C. Lipton Published: 2024-01-11Area: Safety EvaluationCitations: 351 Tags: ai-safety, benchmark, safety-evaluation | 2024-01-11 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 351 |
| AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models Beichen Wang, Chong Zhang, Dong Shu, Mingyu Jin Published: 2024-01-17Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-01-17 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 27 |
| R-Judge: Benchmarking Safety Risk Awareness for LLM Agents Binglin Zhou, Fangqi Li, Gongshen Liu, Lingzhong Dong Published: 2024-01-18Area: Agent SafetyCitations: 156 Tags: agent-safety, ai-safety, benchmark | 2024-01-18 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 156 |
| HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Andy Zou, Bo Li, Dan Hendrycks, David Forsyth Published: 2024-02-06Area: Safety EvaluationCitations: 830 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-02-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (95%) | 830 |
| SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models Bowen Dong, Dahua Lin, Jing Shao, Lijun Li Published: 2024-02-07Area: Safety EvaluationCitations: 193 Tags: ai-safety, benchmark, safety-evaluation | 2024-02-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 193 |
| Comprehensive Assessment of Jailbreak Attacks Against LLMs Junjie Chu, Michael Backes, Xinyue Shen, Yang Zhang Published: 2024-02-08Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R4 (99%) | 90 |
| Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation Alicia Parrish, Charvi Rastogi, Erin van Liemt, Hannah Rose Kirk Published: 2024-02-14Area: Safety EvaluationCitations: 19 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-14 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 19 |
| A StrongREJECT for Empty Jailbreaks Alexandra Souly, Dillon Bowen, Elvis Hsieh, Justin Svegliato Published: 2024-02-15Area: Safety EvaluationCitations: 217 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-02-15 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 217 |
| CausalGym: Benchmarking Causal Interpretability Methods on Linguistic Tasks Aryaman Arora, Christopher Potts, Dan Jurafsky Published: 2024-02-19Area: Safety EvaluationCitations: 36 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-19 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E5 / R3 (95%) | 36 |
| UnlearnCanvas: A Stylized Image Dataset to Benchmark Machine Unlearning for Diffusion Models Jiancheng Liu, Jinghan Jia, Sijia Liu, Xiaoming Liu Published: 2024-02-19Area: Model EditingCitations: 22 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-02-19 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (96%) | 22 |
| Evaluating Robustness of Generative Search Engine on Adversarial Factoid Questions Junzhe Chen, Lijie Wen, Philip S. Yu, Qun Liu Published: 2024-02-25Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, benchmark | 2024-02-25 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (96%) | 9 |
| RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations Atticus Geiger, Christopher Potts, Jing Huang, Mor Geva Published: 2024-02-27Area: Safety EvaluationCitations: 61 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-27 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E4 / R3 (98%) | 61 |
| InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM Agents Daniel Kang, Qiusi Zhan, Zhixiang Liang, Zifan Ying Published: 2024-03-05Area: Agent SafetyCitations: 251 Tags: agent-safety, ai-safety, benchmark | 2024-03-05 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (96%) | 251 |
| The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning Adam A. Hunt, Adam Khoja, Alexander Pan, Alexandr Wang Published: 2024-03-05Area: Safety EvaluationCitations: 341 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 341 |
| Can LLMs Separate Instructions From Data? And What Do We Even Mean By That? Christoph H. Lampert, Egor Zverev, Mario Fritz, Sahar Abdelnabi Published: 2024-03-11Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, benchmark | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E4 / R3 (96%) | 50 |
| B-AVIBench: Toward Evaluating the Robustness of Large Vision-Language Model on Black-Box Adversarial Visual-Instructions Hao Zhang, Hong Liu, Kaipeng Zhang, Ping Luo Published: 2024-03-14Area: Multimodal SafetyCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (98%) | 28 |