Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| MUSE: Machine Unlearning Six-Way Evaluation for Language Models Ari Holtzman, Chiyuan Zhang, Daogao Liu, Jaechan Lee Published: 2024-07-08Area: Model EditingCitations: 174 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-07-08 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (97%) | 174 |
| T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models Jun Zhu, Lijia Yu, Xiao-Shan Gao, Yibo Miao Published: 2024-07-08Area: Multimodal SafetyCitations: 45 Tags: ai-safety, benchmark, multimodal-safety | 2024-07-08 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E7 / R3 (98%) | 45 |
| AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies Andy Zhou, Bo Li, Dawn Song, Jeffrey Ziwei Tan Published: 2024-07-11Area: Safety EvaluationCitations: 55 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 55 |
| InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques Adri脿 Garriga-Alonso, Iv谩n Arcuschin, Rohan Gupta, Thomas Kwa Published: 2024-07-19Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-07-19 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (98%) | 7 |
| Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress? Adam Khoja, Alexander Pan, Alice Gatti, Dan Hendrycks Published: 2024-07-31Area: Safety EvaluationCitations: 53 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-31 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (94%) | 53 |
| CyberSecEval 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models Cyrus Nikolaidis, Daniel Song, David Molnar, James Crnkovich Published: 2024-08-02Area: Safety EvaluationCitations: 39 Tags: ai-safety, benchmark, safety-evaluation | 2024-08-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 39 |
| RiskAwareBench: Towards Evaluating Physical Risk Awareness for High-level Planning of LLM-based Embodied Agents Baoyuan Wu, Bingzhe Wu, Zhengyou Zhang, Zihao Zhu Published: 2024-08-08Area: Agent SafetyCitations: 14 Tags: agent-safety, ai-safety, benchmark | 2024-08-08 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (95%) | 14 |
| MMJ-Bench: A Comprehensive Study on Jailbreak Attacks and Defenses for Vision Language Models Chengyan Fu, Fenghua Weng, Wenjie Wang, Yue Xu Published: 2024-08-16Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-08-16 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E8 / R3 (98%) | - |
| Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks Dongxia Wang, Jiaying Chen, Kexin Chen, Wenhai Wang Published: 2024-08-18Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |
| PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action Diyi Yang, Tianshi Li, Weiyan Shi, Yanchen Liu Published: 2024-08-29Area: Safety EvaluationCitations: 94 Tags: ai-safety, benchmark, safety-evaluation | 2024-08-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 94 |
| Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models Bang An, Furong Huang, Michael-Andrei Panaitescu-Liess, Ruiyi Zhang Published: 2024-09-01Area: Safety EvaluationCitations: 30 Tags: ai-safety, benchmark, safety-evaluation | 2024-09-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 30 |
| TracrBench: Generating Interpretability Testbeds with Large Language Models Hannes Thurnherr, J茅r茅my Scheurer Published: 2024-09-07Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-09-07 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (97%) | 4 |
| AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents Anubha Kabra, Faeze Brahman, Julia Mendelsohn, Maarten Sap Published: 2024-09-13Area: Deception & FailureCitations: 22 Tags: ai-safety, benchmark, deception-failure | 2024-09-13 | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R3 (96%) | 22 |
| HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions Bill Yuchen Lin, Faeze Brahman, Frank Xu, Hao Zhu Published: 2024-09-24Area: Agent SafetyCitations: 34 Tags: agent-safety, ai-safety, benchmark | 2024-09-24 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (95%) | 34 |
| Multimodal Pragmatic Jailbreak on Text-to-image Models Gengyuan Zhang, Jindong Gu, Philip Torr, Tong Liu Published: 2024-09-27Area: Multimodal SafetyCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-09-27 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (95%) | 12 |
| GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks Chang Hu, Han Chen, Meng Han, Minjie Chen Published: 2024-09-29Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark | 2024-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R4 (98%) | 7 |
| Identifying Knowledge Editing Types in Large Language Models Bin Ji, Huijun Liu, Jie Yu, Jun Ma Published: 2024-09-29Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2024-09-29 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 3 |
| Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents Chenlu Zhan, Hanrong Zhang, Hongwei Wang, Jingyuan Huang Published: 2024-10-03Area: Agent SafetyCitations: 123 Tags: agent-safety, ai-safety, benchmark | 2024-10-03 | Agent Safety | agent-safety, ai-safety, benchmark | E7 / R4 (99%) | 123 |
| Holistic Unlearning Benchmark: A Multi-Faceted Evaluation for Text-to-Image Diffusion Model Unlearning Dongwoo Kim, Minjong Lee, Saemi Moon, Sangdon Park Published: 2024-10-08Area: Safety EvaluationCitations: 9 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 9 |
| PII-Scope: A Benchmark for Training Data PII Leakage Assessment in LLMs Ahmed Frikha, Krishna Kanth Nakka, Ricardo Mendes, Xuebing Zhou Published: 2024-10-09Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (98%) | 4 |
| Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities Andrey Anurin, Esben Kran, Jason Schreiber, Jonathan Ng Published: 2024-10-10Area: Safety EvaluationCitations: 7 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents Alexandra Souly, Andy Zou, Dan Hendrycks, Derek Duenas Published: 2024-10-11Area: Adversarial RobustnessCitations: 148 Tags: adversarial-robustness, ai-safety, benchmark | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 148 |
| JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework Dawei Yin, Fan Liu, Hao Liu, Lixin Su Published: 2024-10-11Area: Safety EvaluationCitations: 36 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-10-11 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 36 |
| PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning David Krueger, Fazl Barez, Mrinank Sharma, Philip Torr Published: 2024-10-11Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, benchmark | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R4 (94%) | 26 |
| Refusal-Trained LLMs Are Easily Jailbroken As Browser Agents Elaine Chang, Elaine Lau, Matt Fredrikson, Priyanshu Kumar Published: 2024-10-11Area: Agent SafetyCitations: 54 Tags: agent-safety, ai-safety, benchmark | 2024-10-11 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 54 |
| Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs Leyi Yang, Linsheng Lu, Qi Zhang, Rui Zheng Published: 2024-10-15Area: Deception & FailureCitations: 11 Tags: ai-safety, benchmark, deception-failure | 2024-10-15 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R4 (97%) | 11 |
| CLEAR: Character Unlearning in Textual and Visual Modalities Aibek Alanov, Alexey Dontsov, Alexey Zhavoronkin, Boris Mikheev Published: 2024-10-23Area: Model EditingCitations: 15 Tags: ai-safety, benchmark, model-editing | 2024-10-23 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (94%) | 15 |
| MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control Dongyoon Hahm, June Suk Choi, Juyong Lee, Kimin Lee Published: 2024-10-23Area: Agent SafetyCitations: 26 Tags: agent-safety, ai-safety, benchmark | 2024-10-23 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (95%) | 26 |
| ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models Bing Wang, Bingyi Jing, Guanhua Chen, Haifeng Bai Published: 2024-10-24Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (98%) | 6 |
| SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models Aishan Liu, Dacheng Tao, Jinyang Guo, Lei Huang Published: 2024-10-24Area: Multimodal SafetyCitations: 44 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2024-10-24 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 44 |