Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym Bela Gipp, Jan Philip Wahle, Lars Benedikt Kaesberg, Niklas Bauer Published: 2026-04-10Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-10 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (95%) | - |
| On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework Dario Maio Published: 2026-04-10Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-04-10 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E5 / R3 (95%) | - |
| SAGE: A Service Agent Graph-guided Evaluation Benchmark Chaozheng Wang, Deiyi Xiong, Jinpeng Wang, Ling Shi Published: 2026-04-10Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-10 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (95%) | - |
| Demographic and Linguistic Bias Evaluation in Omnimodal Language Models Alaa Elobaid Published: 2026-04-11Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-11 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E6 / R3 (98%) | - |
| FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks Anke Xu, Haohang Li, Jimin Huang, Jordan W. Suchow Published: 2026-04-11Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-11 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation Bao Peng, DanDan Zheng, Heng Huang, Huaye Wang Published: 2026-04-11Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-11 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R4 (97%) | - |
| FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning Aoqi Zuo, Haotian Xie, Jing Ma, Mingming Gong Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation Yanjie He Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R3 (96%) | - |
| TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training Hao Chen, Hayes Bai, Hongyu Zhu, Jindong Wang Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (99%) | - |
| ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks Samuel Sameer Tanguturi Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R3 (99%) | - |
| Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval Andreas Rauber, Dzenan Hamzic, Florian Skopik, Markus Wurzenberger Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs Fan Yang, Koichi Onoue, Shaunak A. Mehta, Wenkai Li Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs Fan Yang, Koichi Onoue, Shaunak A. Mehta, Wenkai Li Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees Haoyue Liu, Xiaoying Tang, Xiaoyu Ma, Ye Chen Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents Changyu Zeng, Hao Wu, Wei Xing, Xiaoyu Shen Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities Bo Ding, Dawei Feng, Jiacheng Qin, JiaQi Liao Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Can AI Tools Transform Low-Demand Math Tasks? An Evaluation of Task Modification Capabilities Brenda L. Robles, Christian D. Schunn, Danielle S. Fox, Elizabeth DiPietro Brovey Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Development, Evaluation, and Deployment of a Multi-Agent System for Thoracic Tumor Board Faraah Bekheet, Joel Neal, Nerissa Ambers, Nigam H. Shah Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| GF-Score: Certified Class-Conditional Robustness Evaluation with Fairness Guarantees Arya Shah, Kaveri Visavadiya, Manisha Padala Published: 2026-04-14Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-04-14 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E7 / R3 (96%) | - |
| ROSE: An Intent-Centered Evaluation Metric for NL2SQL Boyan Li, Han Chen, Shizheng Hou, Wenqi Pei Published: 2026-04-14Area: cs.DBCitations: - Tags: ai-safety, csdb, preprint, safety-evaluation | 2026-04-14 | cs.DB | ai-safety, csdb, preprint, safety-evaluation | E5 / R3 (95%) | - |
| EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation Alessandra Piscitelli, Alessia Longo, Antonio Cristiano, Bianca Destro Castaniti Published: 2026-04-15Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-15 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R5 (95%) | - |
| Evaluation of Agents under Simulated AI Marketplace Dynamics Alireza Salemi, Fernando Diaz, Hamed Zamani, To Eun Kim Published: 2026-04-15Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-04-15 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Mamba-SSM with LLM Reasoning for Biomarker Discovery: Causal Feature Refinement via Chain-of-Thought Gene Evaluation Aijing Feng, Pushpa Kumar Balan Published: 2026-04-15Area: q-bio.QMCitations: - Tags: ai-safety, preprint, q-bioqm, safety-evaluation | 2026-04-15 | q-bio.QM | ai-safety, preprint, q-bioqm, safety-evaluation | E5 / R3 (96%) | - |
| AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment Ilya Dikman, Michael Winokur, Natan Levy, Oz Levy Published: 2026-04-16Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-04-16 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E6 / R3 (95%) | - |
| An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics ChengXiang Zhai, Miri Liu Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX Dongrui Liu, Haoyu Luo, Jing Shao, Tianyi Zhou Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models Emily Curl, Kofi Ampomah, Md Erfan, Sayanton Dibbo Published: 2026-04-16Area: cs.CVCitations: - Tags: adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | 2026-04-16 | cs.CV | adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | E17 / R6 (99%) | - |
| Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (93%) | - |
| Context Over Content: Exposing Evaluation Faking in Automated Judges Dhruv Kumar, Inderjeet Nair, Lu Wang, Manan Gupta Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation Chengkang Jiang, Fanyu Meng, He Zhu, Jiaheng Liu Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (96%) | - |