Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures Sibei Yang, Wenjie Wang, Yukai Zhou Published: 2025-06-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, benchmark | 2025-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | 2 |
| TAI3: Testing Agent Integrity in Interpreting User Intent Kaiyuan Zhang, Mingwei Zheng, Shiwei Feng, Syed Yusuf Ahmed Published: 2025-06-09Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, benchmark | 2025-06-09 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (94%) | 2 |
| OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics Andrew McCallum, Anmol Mekala, J. Zico Kolter, Pratyush Maini Published: 2025-06-14Area: Model EditingCitations: 21 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-14 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (99%) | 21 |
| Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025 Aishan Liu, Alan Yuille, Changting Lin, Dacheng Tao Published: 2025-06-14Area: Multimodal SafetyCitations: 10 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R4 (97%) | 10 |
| Understanding and Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding Hang Su, Jun Zhu, Meng Wang, Richang Hong Published: 2025-06-14Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-06-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (97%) | 1 |
| ContextBench: Modifying Contexts for Targeted Latent Activation Alexander Chia, Edward Stevinson, Joseph Isaac Bloom, Joseph Miller Published: 2025-06-15Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | - |
| AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions Aishan Liu, Dacheng Tao, Jiakai Wang, Jinyang Guo Published: 2025-06-17Area: Agent SafetyCitations: 13 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-06-17 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E5 / R4 (99%) | 13 |
| FORTRESS: Frontier Risk Evaluation for National Security and Public Safety Christina Q. Knight, Julian Michael, Kaustubh Deshpande, Meher Mankikar Published: 2025-06-17Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 6 |
| OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents Agatha Duzan, Francesco Croce, Hao Zhao, Maksym Andriushchenko Published: 2025-06-17Area: Agent SafetyCitations: 29 Tags: agent-safety, ai-safety, benchmark | 2025-06-17 | Agent Safety | agent-safety, ai-safety, benchmark | E6 / R3 (95%) | 29 |
| SHADE Arena: Sabotage Monitoring for LLM Agents Buck Shlegeris, Chen Bo Calvin Zhang, Henry Sleight, Joe Benton Published: 2025-06-17Area: Agent SafetyCitations: 18 Tags: agent-safety, ai-safety, benchmark | 2025-06-17 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R4 (95%) | 18 |
| IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks Dongrui Liu, Jing Shao, Lu Sheng, Weichen Zhang Published: 2025-06-19Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 8 |
| PL-Guard: Benchmarking Language Model Safety for Polish Aleksandra Krasnod臋bska, Karolina Seweryn, Szymon 艁ukasik, Wojciech Kusa Published: 2025-06-19Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| PRISON: Unmasking the Criminal Potential of Large Language Models Geng Hong, Min Yang, Pei Chen, Xinyi Wu Published: 2025-06-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 3 |
| Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm Ali Payani, Baixiang Huang, Dawei Li, Haoran Wang Published: 2025-06-25Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-06-25 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (95%) | - |
| OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety Aditya Bharat Soni, Graham Neubig, Maarten Sap, Nouha Dziri Published: 2025-07-08Area: Agent SafetyCitations: 13 Tags: agent-safety, ai-safety, benchmark | 2025-07-08 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (95%) | 13 |
| The Bitter Lesson of Misuse Detection Charbel-Rapha毛l Segerie, Diego Dorn, Hadrien Mariaccia Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models Adam Gleave, Ann-Kathrin Dombrowski, Chris Cundy, Dillon Bowen Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (94%) | - |
| GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing Haibo Jin, Haohan Wang, Liying Kang, Peiyan Zhang Published: 2025-07-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 3 |
| Benchmarking Deception Probes via Black-to-White Performance Boosts Aviel Parrack, Carlo Leonardo Attubato, Stefan Heimersheim Published: 2025-07-16Area: Deception & FailureCitations: 8 Tags: ai-safety, benchmark, deception-failure | 2025-07-16 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (93%) | 8 |
| TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law Ehsan Shareghi, Nigel Collier, Yijiang River Dong, Zheng Hui Published: 2025-07-22Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-07-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (99%) | 4 |
| Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition Alexander Grattan, Andy Zou, Ayla Croft, Dan Hendrycks Published: 2025-07-28Area: Agent SafetyCitations: 10 Tags: agent-safety, ai-safety, benchmark | 2025-07-28 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 10 |
| Measuring Harmfulness of Computer-Using Agents Aaron Xuxiang Tian, Janet Tang, Jiaxin Wen, Ruofan Zhang Published: 2025-07-31Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark | 2025-07-31 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (97%) | 1 |
| Towards Evaluation for Real-World LLM Unlearning Ke Miao, Kui Ren, Wenjie Bao, Xiaochen Li Published: 2025-08-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-08-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E4 / R3 (95%) | - |
| Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models Aiwei Liu, Bolin Ding, Felix Henry, Leyi Pan Published: 2025-08-10Area: Multimodal SafetyCitations: 2 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-08-10 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 2 |
| The PacifAIst Benchmark: Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety? Manuel Herrador Mu帽oz Published: 2025-08-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |
| Systematic Analysis of MCP Security Peng Di, Puzhuo Liu, Sheng Wen, Wanlun Ma Published: 2025-08-18Area: Agent SafetyCitations: 17 Tags: agent-safety, ai-safety, benchmark | 2025-08-18 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 17 |
| MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers Guanquan Shi, Haifeng Sun, Haohua Du, Haoran Cheng Published: 2025-08-19Area: Agent SafetyCitations: 17 Tags: agent-safety, ai-safety, benchmark | 2025-08-19 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 17 |
| Side Effects of Erasing Concepts from Diffusion Models Manas Gaur, Shaswati Saha, Sourajit Saha, Tejas Gokhale Published: 2025-08-20Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing | 2025-08-20 | Model Editing | ai-safety, benchmark, model-editing | E9 / R3 (94%) | 2 |
| Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation Chang Liu, Hang Su, Huanran Chen, Jun Zhu Published: 2025-08-21Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2025-08-21 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 1 |
| Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs Daeun Moon, Hyejin Chung, Hyunsoo Yoon, Jiwon Kim Published: 2025-08-23Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | - |