Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models Ashish Hallur, Georgi Tinchev, Hao Zhang, Laureano Moro-Velazquez Published: 2026-07-06Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-06 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R9 (94%) | - |
| SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation Carsten Maple, Linxi Li, Liwei Jin, Qianwei Guo Published: 2026-07-06Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-07-06 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E13 / R13 (94%) | - |
| Three-Phase Evaluation of AI-Assisted Software Development Life Cycle Carson Crockett, Jacob Viehe, Jason Ferraro, Joshua Strubel Published: 2026-07-06Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-07-06 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E14 / R15 (91%) | - |
| evalci: A Python Library for Statistically Rigorous Comparison of Language Model Evaluations Shreyas K Chandrahas Published: 2026-07-05Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-05 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E11 / R12 (92%) | - |
| Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese) Ken Ito, Shigekazu Ishihara, Yusei Tamura Published: 2026-07-05Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-07-05 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E8 / R8 (93%) | - |
| RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies Baijun Chen, Dandan Zhang, Enze Xie, Guanyu Lin Published: 2026-07-05Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-07-05 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E22 / R27 (94%) | - |
| RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies Baijun Chen, Dandan Zhang, Enze Xie, Guanyu Lin Published: 2026-07-05Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-07-05 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E21 / R21 (91%) | - |
| A Unified Algebraic Framework for Classification Performance Evaluation Ronaldo C. Prati Published: 2026-07-04Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-04 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E8 / R8 (90%) | - |
| ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation Enshuo Hsu, Jin Zhou, Kirk Roberts Published: 2026-07-04Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-04 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E12 / R11 (94%) | - |
| How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation Ehsan Javanmardi, Fardin Ayar, Mahdi Javanmardi, Manabu Tsukada Published: 2026-07-04Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-04 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E10 / R9 (95%) | - |
| Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions Dipo Dunsin, Ed de Quincey, Eduardo Almeida Palmieri, Kim-Kwang Raymond Choo Published: 2026-07-03Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-07-03 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E8 / R8 (94%) | - |
| CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI Roopam W. Sure Published: 2026-07-03Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-07-03 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E9 / R8 (93%) | - |
| The Foreign Policy AI Evaluation Gap Charles Pozniak, Jeba Sania Published: 2026-07-03Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-07-03 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E12 / R16 (95%) | - |
| TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation Axel TahmasebiMoradi, Lucas Schott, Martin Royer Published: 2026-07-03Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-07-03 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E10 / R8 (93%) | - |
| Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias Kevin Vorwalder, Nico Pfeifer, Sofiane Ouaari Published: 2026-07-02Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-02 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E7 / R4 (96%) | - |
| CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training Chenyang Zhao, Fangfei Li, Feng Tian, Long Wang Published: 2026-07-02Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-02 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R4 (96%) | - |
| JavaVulBench: A Java Vulnerability Benchmark with Realistic Splits, a Unified Multi-Backend Harness, and a Leakage-Aware Evaluation Mode Gabor Antal, Norbert Sandor Szolnoki Published: 2026-07-02Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-07-02 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E35 / R24 (94%) | - |
| Meta-Benchmarks for Financial-Services LLM Evaluation Blair Hudson Published: 2026-07-02Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-02 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R5 (95%) | - |
| PACE: A Proxy for Agentic Capability Evaluation Aditya Bharat Soni, Daniel Lee, Graham Neubig, Jiarui Liu Published: 2026-07-02Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-02 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E38 / R32 (91%) | - |
| PACE: A Proxy for Agentic Capability Evaluation Aditya Bharat Soni, Daniel Lee, Graham Neubig, Jiarui Liu Published: 2026-07-02Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-02 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R5 (98%) | - |
| Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity Brett Reynolds Published: 2026-07-01Area: cs.CLCitations: - Tags: adversarial-robustness, ai-safety, cscl, preprint, safety-evaluation | 2026-07-01 | cs.CL | adversarial-robustness, ai-safety, cscl, preprint, safety-evaluation | E9 / R4 (95%) | - |
| Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions Zewen Liu Published: 2026-07-01Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-01 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E9 / R3 (97%) | - |
| TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue Georgi Tinchev, Hao Zhang, Laureano Moro-Velazquez, Thomas Thebaud Published: 2026-07-01Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-01 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E11 / R9 (88%) | - |
| TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue Georgi Tinchev, Hao Zhang, Laureano Moro-Velazquez, Thomas Thebaud Published: 2026-07-01Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-01 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R5 (98%) | - |
| A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks Jinliang Xu, Liping Ma Published: 2026-06-30Area: cs.NECitations: - Tags: ai-safety, csne, preprint, safety-evaluation | 2026-06-30 | cs.NE | ai-safety, csne, preprint, safety-evaluation | E8 / R5 (99%) | - |
| A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks Jinliang Xu, Liping Ma Published: 2026-06-30Area: cs.NECitations: - Tags: ai-safety, csne, preprint, safety-evaluation | 2026-06-30 | cs.NE | ai-safety, csne, preprint, safety-evaluation | E10 / R9 (93%) | - |
| Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian Adrian Paschke, Ciprian-Octavian Truica, Dragos-Mitrut Vasile, Elena-Simona Apostol Published: 2026-06-30Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-30 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R4 (99%) | - |
| Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law Chang Sun, Noah Scharrenberg Published: 2026-06-30Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-30 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R4 (96%) | - |
| SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework Carolina Gustafson, Diane Litman, Gayle Rogers, Norah Almousa Published: 2026-06-30Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-30 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R4 (99%) | - |
| Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency Nisarg A. Patel Published: 2026-06-29Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-29 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R4 (95%) | - |