Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ROSE: An Intent-Centered Evaluation Metric for NL2SQL Boyan Li, Han Chen, Shizheng Hou, Wenqi Pei Published: 2026-04-14Area: cs.DBCitations: - Tags: ai-safety, csdb, preprint, safety-evaluation | 2026-04-14 | cs.DB | ai-safety, csdb, preprint, safety-evaluation | E5 / R3 (95%) | - |
| ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks Samuel Sameer Tanguturi Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R3 (99%) | - |
| Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval Andreas Rauber, Dzenan Hamzic, Florian Skopik, Markus Wurzenberger Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs Fan Yang, Koichi Onoue, Shaunak A. Mehta, Wenkai Li Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs Fan Yang, Koichi Onoue, Shaunak A. Mehta, Wenkai Li Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees Haoyue Liu, Xiaoying Tang, Xiaoyu Ma, Ye Chen Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents Changyu Zeng, Hao Wu, Wei Xing, Xiaoyu Shen Published: 2026-04-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning Aoqi Zuo, Haotian Xie, Jing Ma, Mingming Gong Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation Yanjie He Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R3 (96%) | - |
| TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training Hao Chen, Hayes Bai, Hongyu Zhu, Jindong Wang Published: 2026-04-12Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-12 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (99%) | - |
| Demographic and Linguistic Bias Evaluation in Omnimodal Language Models Alaa Elobaid Published: 2026-04-11Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-11 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E6 / R3 (98%) | - |
| FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks Anke Xu, Haohang Li, Jimin Huang, Jordan W. Suchow Published: 2026-04-11Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-11 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation Bao Peng, DanDan Zheng, Heng Huang, Huaye Wang Published: 2026-04-11Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-11 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R4 (97%) | - |
| BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation C茅line Hudelot, Emmanuel Malherbe, Hippolyte Gisserot-Boukhlef, Nicolas Boizard Published: 2026-04-10Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-10 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (93%) | - |
| Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition Kai Yu, Peng Wang, Qinyuan Chen, Wupeng Wang Published: 2026-04-10Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-10 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R3 (97%) | - |
| Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition Kai Yu, Peng Wang, Qinyuan Chen, Wupeng Wang Published: 2026-04-10Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-10 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models Avni Mittal, Monojit Choudhury, Sandipan Dandapat, Shanu Kumar Published: 2026-04-10Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-10 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (93%) | - |
| Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym Bela Gipp, Jan Philip Wahle, Lars Benedikt Kaesberg, Niklas Bauer Published: 2026-04-10Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-10 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (95%) | - |
| On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework Dario Maio Published: 2026-04-10Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-04-10 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E5 / R3 (95%) | - |
| SAGE: A Service Agent Graph-guided Evaluation Benchmark Chaozheng Wang, Deiyi Xiong, Jinpeng Wang, Ling Shi Published: 2026-04-10Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-10 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (95%) | - |
| ACIArena: Toward Unified Evaluation for Agent Cascading Injection Changjiang Li, Chunyi Zhou, Hengyu An, Jinghuai Zhang Published: 2026-04-09Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-09 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (97%) | - |
| An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks Adrian-Marius Dumitran, Gabriel Stefan Published: 2026-04-09Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-09 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (97%) | - |
| AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan Guangtao Zhai, Haonan Cheng, Hengyan Huang, Jian Liu Published: 2026-04-09Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-04-09 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E5 / R3 (96%) | - |
| AtomEval: Atomic Evaluation of Adversarial Claims in Fact Verification Hanze Jia, Hongyi Cen, Jingyi Zheng, Mingxin Wang Published: 2026-04-09Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint, safety-evaluation | 2026-04-09 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (97%) | - |
| AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation Chong Luo, Lili Qiu, Qi Dai, Rui Wang Published: 2026-04-09Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-09 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E6 / R3 (94%) | - |
| Can Vision Language Models Judge Action Quality? An Empirical Evaluation Miguel Monte e Freitas, Pedro Henrique Martins, Ricardo Rei, Rui Henriques Published: 2026-04-09Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-09 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E8 / R3 (98%) | - |
| CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V Can Gurkan, John Chen, Mingyi Lin, Sihan Cheng Published: 2026-04-09Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-09 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (93%) | - |
| KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation Fei Tang, Guocheng Shao, Jun Xiao, Kaitao Song Published: 2026-04-09Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-09 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (97%) | - |
| On Semiotic-Grounded Interpretive Evaluation of Generative Art Changwen Chen, Ruixiang Jiang Published: 2026-04-09Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-09 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R3 (95%) | - |
| PIArena: A Platform for Prompt Injection Evaluation Chenlong Yin, Jinyuan Jia, Runpeng Geng, Yanting Wang Published: 2026-04-09Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-04-09 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E4 / R3 (95%) | - |