Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law Alexander M眉ller, Ilija Lichkovski, Mariam Ibrahim, Tiwai Mhundwa Published: 2025-10-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 1 |
| GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments? Chiyu Chen, Gongshen Liu, Haodong Zhao, Jie Li Published: 2025-10-23Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R4 (97%) | 2 |
| VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety Charles Maalouf, Gunnar Lund, Jeffrey Bigham, Joseph Yitan Cheng Published: 2025-10-21Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-10-21 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E5 / R3 (96%) | - |
| MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents Dongsen Zhang, Peipei Li, Wenjun Xu, Xuannan Liu Published: 2025-10-14Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, benchmark | 2025-10-14 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (98%) | 2 |
| SafeMT: Multi-turn Safety for Multimodal Language Models Boyuan Chen, Chengkun Cai, Chi-Min Chan, Han Zhu Published: 2025-10-14Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-10-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | 3 |
| DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models Kaixuan Ren, Preslav Nakov, Usman Naseem Published: 2025-10-12Area: Multimodal SafetyCitations: 1 Tags: ai-safety, benchmark, multimodal-safety | 2025-10-12 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E6 / R3 (95%) | 1 |
| Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs Chenxuan Zhao, Ercong Nie, Michael F盲rber, Shuzhou Yuan Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E8 / R3 (96%) | 1 |
| Multimodal Safety Evaluation in Generative Agent Social Simulations Alhim Vera, Bernard Ghanem, Carlos Hinojosa, Donghoon Kim Published: 2025-10-09Area: Multimodal SafetyCitations: 1 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-10-09 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R3 (96%) | 1 |
| Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach Abhejay Murali, Amit Dhurandhar, David Atkinson, Junfeng Jiao Published: 2025-10-07Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 1 |
| SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests Devansh Bhardwaj, Hai Son Le, Punya Syon Pandey, Rada Mihalcea Published: 2025-10-06Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-10-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | - |
| Read the Scene, Not the Script: Outcome-Aware Safety for LLMs Rui Wu, Ruixiang Tang, Yanshu Li, Yihao Quan Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 1 |
| Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness Besmira Nushi, Erfan Shayegani, Keegan Hines, Nael Abu-Ghazaleh Published: 2025-10-02Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark | 2025-10-02 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 1 |
| Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Shoumik Saha Published: 2025-10-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (94%) | 2 |
| ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs Adi Simhi, Idan Szpektor, Itay Itzhak, Jonathan Herzig Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | 1 |
| OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always! Amir Zadeh, Chuan Li, Jingdi Lei, Rishabh Bhardwaj Published: 2025-09-30Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-30 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 2 |
| Generative Value Conflicts Reveal LLM Priorities Andy Liu, Atoosa Kasirzadeh, Daniel Fried, Kshitish Ghate Published: 2025-09-29Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (92%) | 3 |
| HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment Di Wang, Kedong Xiu, Kui Ren, Langqi Yang Published: 2025-09-29Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| SafeSearch: Automated Red-Teaming for the Safety of LLM-Based Search Agents Han Qiu, Hao Wang, Jianshuo Dong, Ke Xu Published: 2025-09-28Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2025-09-28 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (94%) | - |
| D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models Andy Zou, Dan Hendrycks, Eliot Krzysztof Jones, J. Zico Kolter Published: 2025-09-22Area: Deception & FailureCitations: 2 Tags: ai-safety, benchmark, deception-failure | 2025-09-22 | Deception & Failure | ai-safety, benchmark, deception-failure | E6 / R3 (97%) | 2 |
| SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs Chenguang Wang, David Park, Dawn Song, Nathan W. Henry Published: 2025-09-16Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E9 / R3 (95%) | 4 |
| Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential Aarav Khanna, Charankumar Akiri, Harrison Simpson, Kshitiz Aryal Published: 2025-09-12Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E10 / R3 (95%) | 4 |
| HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis Published: 2025-09-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 3 |
| SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs Haifeng Wang, Hongfei Xiao, Hongru Wang, Qian Yu Published: 2025-09-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-09-09 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 1 |
| Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models Mohammad Zandsalimy, Shanu Sushmita, Youjia Zheng Published: 2025-09-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions Chang Liu, Cheng Wei, Fengxiang Wang, Hui Xue Published: 2025-09-01Area: Safety EvaluationCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-01 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 7 |
| CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders Alex Gulko, Sachin Kumar, Yusen Peng Published: 2025-08-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-08-31 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring Chao Shen, Chenhao Lin, Junjie Chu, Michael Backes Published: 2025-08-28Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-08-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 4 |
| Evaluating Language Model Reasoning about Confidential Information Alexander Robey, Andy Zou, Dylan Sam, J. Zico Kolter Published: 2025-08-27Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-08-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (93%) | 1 |
| Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs Daeun Moon, Hyejin Chung, Hyunsoo Yoon, Jiwon Kim Published: 2025-08-23Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | - |
| Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks Ethan Perez, Henry Sleight, Jack Youstra, Mohammed Mahfoud Published: 2025-08-23Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark | 2025-08-23 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 7 |