Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs Ambrish Rawat, Beat Buesser, Giandomenico Cornacchia, Giulio Zizzo Published: 2025-02-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 12 |
| GuidedBench: Equipping Jailbreak Evaluation with Guidelines Daoyuan Wu, Ruixuan Huang, Shuai Wang, Xunguang Wang Published: 2025-02-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| FaithUn: Toward Faithful Forgetting in Language Models by Investigating the Interconnectedness of Knowledge Joongbo Shin, Kyomin Jung, Minsung Kim, Nakyeong Yang Published: 2025-02-26Area: Model EditingCitations: 6 Tags: ai-safety, benchmark, model-editing | 2025-02-26 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 6 |
| JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models Haoran Bu, Shuyi Liu, Simiao Cui, Xi Zhang Published: 2025-02-26Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 2 |
| Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models Dacheng Tao, Haifeng Sun, Huazheng Wang, Jianxin Liao Published: 2025-02-27Area: Model EditingCitations: 1 Tags: ai-safety, benchmark, model-editing | 2025-02-27 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (97%) | 1 |
| The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems Adam Khoja, Alice Gatti, Arunim Agarwal, Brad Kenstler Published: 2025-03-05Area: Safety EvaluationCitations: 26 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-03-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 26 |
| SafeArena: Evaluating the Safety of Autonomous Web Agents Ada Defne Tur, Alejandra Zambrano, Arkil Patel, Esin Durmus Published: 2025-03-06Area: Safety EvaluationCitations: 40 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 40 |
| AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Kamalika Chaudhuri Published: 2025-03-12Area: Agent SafetyCitations: 31 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-03-12 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 31 |
| SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability Adam Karvonen, Arthur Conmy, Callum McDougall, Can Rager Published: 2025-03-12Area: Mechanistic Interp.Citations: 62 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-03-12 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 62 |
| DarkBench: Benchmarking Dark Patterns in Large Language Models Akash Kundu, Esben Kran, Jinsuk Park, Jord Nguyen Published: 2025-03-13Area: Safety EvaluationCitations: 18 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R4 (97%) | 18 |
| ExtremeAIGC: Benchmarking LMM Vulnerability to AI-Generated Extremist Content Bhavik Chandna, Mariam Aboujenane, Usman Naseem Published: 2025-03-13Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-03-13 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E6 / R3 (95%) | 1 |
| A Framework for Evaluating Emerging Cyberattack Capabilities of AI Allan Dafoe, Anna Wang, Four Flynn, Lihao Liang Published: 2025-03-14Area: Safety EvaluationCitations: 24 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 24 |
| Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attack Murong Yue, Ziyu Yao Published: 2025-03-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-03-18 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| Measuring AI Ability to Complete Long Tasks Amy Deng, Ben West, Brian Goodrich, Chris Painter Published: 2025-03-18Area: Safety EvaluationCitations: 96 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 96 |
| Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings Aishan Liu, Dacheng Tao, Deyue Zhang, Guangyi Zheng Published: 2025-03-19Area: Safety EvaluationCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-03-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 28 |
| A Benchmark for Scalable Oversight Protocols Abhimanyu Pallavi Sudhir, Arjun Panickssery, Jackson Kaunismaa Published: 2025-03-31Area: Scalable OversightCitations: 1 Tags: ai-safety, benchmark, scalable-oversight | 2025-03-31 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E6 / R3 (95%) | 1 |
| Among Us: A Sandbox for Measuring and Detecting Agentic Deception Adri脿 Garriga-Alonso, Satvik Golechha Published: 2025-04-05Area: Deception & FailureCitations: 9 Tags: ai-safety, benchmark, deception-failure | 2025-04-05 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (95%) | 9 |
| MIB: A Mechanistic Interpretability Benchmark Aaron Mueller, Adam Belfki, Alessandro Stolfo, Amir Zur Published: 2025-04-17Area: Mechanistic Interp.Citations: 16 Tags: ai-safety, benchmark, interpretability, mechanistic-interp | 2025-04-17 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp | E6 / R3 (97%) | 16 |
| OpenDeception: Benchmarking and Investigating AI Deceptive Behaviors via Open-ended Interaction Simulation Geng Hong, Min Yang, Xudong Pan, Yichen Wu Published: 2025-04-18Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure | 2025-04-18 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R4 (96%) | - |
| RepliBench: Evaluating Autonomous Replication Capabilities of Language Model Agents Alan Cooney, Alex Remedios, Asa Cooper Stickland, Ben Millwood Published: 2025-04-21Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-04-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 8 |
| WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks Aaron Grattafiori, Arman Zharmagambetov, Chuan Guo, Ivan Evtimov Published: 2025-04-22Area: Adversarial RobustnessCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark | 2025-04-22 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R3 (95%) | 57 |
| SAGE: A Generic Framework for LLM Safety Evaluation Hari Shrawgi, Madhur Jindal, Parag Agrawal, Sandipan Dandapat Published: 2025-04-28Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-04-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | 6 |
| Security Steerability is All You Need Idan Habler, Itay Hazan, Itsik Mantin, Ron Bitton Published: 2025-04-28Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark | 2025-04-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 3 |
| Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation Jie Peng, Mohit Bansal, Peter Hase, Tianlong Chen Published: 2025-05-01Area: Model EditingCitations: 8 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-05-01 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 8 |
| Evaluating Frontier Models for Stealth and Situational Awareness Allan Dafoe, David Lindner, Lewis Ho, Mary Phuong Published: 2025-05-02Area: Safety EvaluationCitations: 16 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |
| REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLMs Madhur Jindal, Saurabh Deshpande Published: 2025-05-07Area: Multimodal SafetyCitations: 3 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R4 (99%) | 3 |
| WaterDrum: Watermarking for Data-centric Unlearning Metric Bryan Kian Hsiang Low, Bui Thi Cam Nhung, Chuan-Sheng Foo, Fanyu Wen Published: 2025-05-08Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-05-08 | Model Editing | ai-safety, benchmark, model-editing | E4 / R3 (96%) | - |
| CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs Chen-Hsiang Yu, Eric Hanchen Jiang, Mengxue Zhang, Qingcheng Zeng Published: 2025-05-16Area: Safety EvaluationCitations: 16 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 16 |
| Phare: A Safety Probe for Large Language Models Beno卯t Mal茅zieux, Matteo Dora, Pierre Le Jeune, Weixuan Xiao Published: 2025-05-16Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R5 (95%) | 1 |
| Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs Huaibo Huang, Peipei Li, Ran He, Shuhan Xia Published: 2025-05-17Area: Multimodal SafetyCitations: 10 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-17 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (95%) | 10 |