Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents Benjamin C. M. Fung, Claude Fachkha, Khalil Al-Hussaeni, Martin Weiss Published: 2025-12-23Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-12-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (98%) | 2 |
| PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models A. B. M. Ashikur Rahman, Ajmal Mian, Irfan Ahmad, Muhammad Usman Published: 2025-12-22Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-12-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| Monitoring Monitorability Annie Y. Wei, Benjamin Arnav, Bowen Baker, Ian Kivlichan Published: 2025-12-20Area: Scalable OversightCitations: 6 Tags: ai-safety, benchmark, safety-evaluation, scalable-oversight | 2025-12-20 | Scalable Oversight | ai-safety, benchmark, safety-evaluation, scalable-oversight | E5 / R3 (95%) | 6 |
| Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models Chenxu Zhao, Mengdi Huai, Wei Qian, Yangyi Li Published: 2025-12-19Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2025-12-19 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (97%) | - |
| Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation Dongqin Liu, Hongchang Yang, Songlin Hu, Wei Zhou Published: 2025-12-18Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2025-12-18 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (95%) | - |
| FAME: Fictional Actors for Multilingual Erasure Alkis Koudounas, Claudio Savelli, Flavio Giobergia, Moreno La Quatra Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-12-17 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (97%) | - |
| A Practical Framework for Evaluating Medical AI Security: Reproducible Assessment of Jailbreaking and Privacy Vulnerabilities Across Clinical Specialties Carter Yagemann, Jinghao Wang, Ping Zhang Published: 2025-12-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R4 (97%) | - |
| OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation Dongxian Wu, Jie Liao, Qi Guo, Ranjie Duan Published: 2025-12-06Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-12-06 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (98%) | 3 |
| TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations Chi Zhang, Huilin Zhou, Jian Zhao, Tianle Zhang Published: 2025-12-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| Are Your Agents Upward Deceivers? Dadi Guo, Dongrui Liu, Haoran Li, Jialing Tao Published: 2025-12-04Area: Deception & FailureCitations: 2 Tags: ai-safety, benchmark, deception-failure | 2025-12-04 | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R2 (94%) | 2 |
| Benchmarking and Understanding Safety Risks in AI Character Platforms Gareth Tyson, Peixian Zhang, Yiluo Wei Published: 2025-12-01Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-12-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |
| When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals Md Labid Al Nahiyan, Md Tanvir Hassan, Riad Ahmed Anonto Published: 2025-11-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-30 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 1 |
| Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models Boyuan Chen, Donghai Hong, Jiaming Ji, Jiayi Zhou Published: 2025-11-29Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-11-29 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E4 / R3 (96%) | - |
| Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts Chaojun Xiao, Felix Steffek, Holli Sargeant, Huimin Chen Published: 2025-11-25Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | - |
| Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion Cong Zuo, Haibin Zhang, Hang Fu, Licheng Wang Published: 2025-11-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| Findings of the BlackboxNLP 2025 Shared Task: Localizing Circuits and Causal Variables in Language Models Aaron Mueller, Dana Arad, Gabriele Sarti, Hanjie Chen Published: 2025-11-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, mechanistic-interp | 2025-11-23 | Mechanistic Interp. | ai-safety, benchmark, mechanistic-interp | E6 / R3 (95%) | - |
| ASTRA: Agentic Steerability and Risk Assessment Framework Guy Shtar, Itay Hazan, Itsik Mantin, Ron Bitton Published: 2025-11-22Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-11-22 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E5 / R3 (96%) | - |
| Why Do Language Model Agents Whistleblow? Asa Cooper Stickland, Frank Xiao, Guido Bergman, Kushal Agrawal Published: 2025-11-21Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-11-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | 1 |
| SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models Chenyang Si, Guanghao Li, Jian Liang, Jianxiong Gao Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Lingjuan Lyu, Yaochu Jin, Yingchao Yu, Yuanshuai Li Published: 2025-11-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard Chao Zhang, Guangzhi Sun, Jimin Zhuang, Jing Shao Published: 2025-11-13Area: Multimodal SafetyCitations: 3 Tags: ai-safety, benchmark, multimodal-safety | 2025-11-13 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E4 / R3 (96%) | 3 |
| Uncovering Strategic Egoism Behaviors in Large Language Models Aishan Liu, Jiangfan Liu, Qihang Zhang, Xianglong Liu Published: 2025-11-13Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| SCALAR: Benchmarking SAE Interaction Sparsity in Toy LLMs Andrew Gordon, David Quarel, Peter Lai, Sean P. Fillingham Published: 2025-11-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, interpretability, mechanistic-interp | 2025-11-10 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations Ahmed Salem, Amr Gomaa, Sahar Abdelnabi Published: 2025-11-07Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2025-11-07 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (93%) | - |
| Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies Christopher Parisien, Liwei Jiang, Makesh Narsimhan Sreedhar, Prasoon Varshney Published: 2025-11-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-07 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems Ameya Rathod, Hemang Jain, Ishan Kavathekar, Ponnurangam Kumaraguru Published: 2025-11-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-11-07 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications Baocheng Chen, Haitian Li, Kecheng Wang, Kejiang Chen Published: 2025-11-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences Ceren Budak, Eric Gilbert, Hua Shen, Joshua Ashkinaze Published: 2025-11-03Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows Ben Kao, Fangzhi Xu, Kanzhi Cheng, Lingpeng Kong Published: 2025-10-28Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, benchmark | 2025-10-28 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (97%) | 4 |
| OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models Hao Zheng, Jiaheng Wei, Ling Li, Xiaobo Xia Published: 2025-10-26Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-10-26 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | - |