Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Efficient Agent Evaluation via Diversity-Guided User Simulation Ateret Anaby-Tavor, George Kour, Itay Nakash Published: 2026-04-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-23 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R5 (98%) | - |
| Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework Anna Rumshisky, Aram Galstyan, Charith Peris, Dan Rosen Published: 2026-04-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-23 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R4 (98%) | - |
| SQLyzr: A Comprehensive Benchmark and Evaluation Platform for Text-to-SQL M. Tamer 脰zsu, Sepideh Abedini Published: 2026-04-23Area: cs.DBCitations: - Tags: ai-safety, csdb, preprint, safety-evaluation | 2026-04-23 | cs.DB | ai-safety, csdb, preprint, safety-evaluation | E11 / R5 (98%) | - |
| SQLyzr: A Comprehensive Benchmark and Evaluation Platform for Text-to-SQL M. Tamer 脰zsu, Sepideh Abedini Published: 2026-04-23Area: cs.DBCitations: - Tags: ai-safety, csdb, preprint, safety-evaluation | 2026-04-23 | cs.DB | ai-safety, csdb, preprint, safety-evaluation | E11 / R4 (98%) | - |
| Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards Minjae Lee, Minji Jung, Minsuk Kahng, Sarang Choi Published: 2026-04-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-23 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R4 (97%) | - |
| Peer Identity Bias in Multi-Agent LLM Evaluation: An Empirical Study Using the TRUST Democratic Discourse Analysis Pipeline Juergen Dietrich Published: 2026-04-24Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-04-24 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E9 / R5 (97%) | - |
| Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity Adam Botach, Asaf Gendler, Erez Yosef, Igor Kviatkovsky Published: 2026-04-24Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (98%) | - |
| Rethinking XAI Evaluation: A Human-Centered Audit of Shapley Benchmarks in High-Stakes Settings Carlos Soares, Hugo Ferreira, Iker Perez, In锚s Oliveira e Silva Published: 2026-04-24Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-04-24 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E8 / R5 (97%) | - |
| An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code Jelena Ili膰 Vuli膰evi膰 Published: 2026-04-25Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-04-25 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E10 / R5 (99%) | - |
| Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines Sadman Kabir Soumik Published: 2026-04-25Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-25 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R4 (98%) | - |
| ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation Aditi Kumaresan, Wenjun Zeng, Yizheng Huang, Zi Wang Published: 2026-04-25Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-04-25 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E6 / R4 (96%) | - |
| Do Transaction-Level and Actor-Level AML Queues Agree? An Empirical Evaluation of Granularity Effects on the Elliptic++ Graph Ankur Malik Published: 2026-04-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R4 (97%) | - |
| Evaluation of Prompt Injection Defenses in Large Language Models Amy Fox, Kelley McAllister, Krisztian Flautner, Kyle Bacon Published: 2026-04-26Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-04-26 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E8 / R4 (98%) | - |
| Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task Hiroaki Yamada, Jungmin Choi, Keisuke Sakaguchi Published: 2026-04-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R5 (97%) | - |
| K-SENSE: A Knowledge-Guided Self-Augmented Encoder for Neuro-Semantic Evaluation of Mental Health Conditions on Social Media Vijay Yadav Published: 2026-04-26Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-26 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E9 / R6 (98%) | - |
| Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus Andrei Zhukov, Anirudh Narayanan, Anna Purcarea, Christopher Zirn Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (95%) | - |
| All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation Chen-An Li, Chih-Kai Yang, Hung-yi Lee, Ke-Han Lu Published: 2026-04-27Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-04-27 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E10 / R4 (100%) | - |
| An empirical evaluation of the risks of AI model updates using clinical data: stability, arbitrariness, and fairness Carlos Castillo, Ioannis Bilionis, Luis Fernandez-Luque, Ricardo C. Berrios Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R4 (97%) | - |
| A systematic evaluation of vision-language models for observational astronomical reasoning tasks Hengxiao Guo, Wenke Ren, Wenwen Zuo, Xiaoman Zhang Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R3 (98%) | - |
| Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters Aaryan Shah, Aida Rutledge, Alexia Downs, Andrew Hines Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (94%) | - |
| Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs Ananya Joshi, Rhea Makkuni Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (97%) | - |
| CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation Bowen Shi, Jianpeng Zhang, Ling Zhang, Ruifeng Yuan Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (98%) | - |
| Failure-Centered Runtime Evaluation for Deployed Trilingual Public-Space Agents M. Meng Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (95%) | - |
| K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology Cheongwoong Kang, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi Published: 2026-04-27Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-27 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R5 (96%) | - |
| Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop Adithi Satish, Ashmi Banerjee, Wolfgang W枚rndl, Yashar Deldjoo Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R4 (98%) | - |
| QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering Junyeong Kim, Woojun Jung Published: 2026-04-27Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-27 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E8 / R6 (98%) | - |
| Understanding the Limits of Automated Evaluation for Code Review Bots in Practice Baykal Mehmet U莽ar, Eray T眉z眉n, Utku Boran Torun, Veli Karakaya Published: 2026-04-27Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-04-27 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E9 / R5 (96%) | - |
| FlowEval: Reference-based Evaluation of Generated User Interfaces Eldon Schoop, Jason Wu, Jeffrey Nichols, Priyan Vaithilingam Published: 2026-05-05Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-05 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E13 / R11 (91%) | - |
| Coordination Matters: Evaluation of Cooperative Multi-Agent Reinforcement Learning Afsaneh Doryab, Maria Ana Cardei, Matthew Landers Published: 2026-05-07Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-07 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E9 / R8 (93%) | - |
| SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis Arti Singh, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde Published: 2026-05-10Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-10 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E20 / R21 (91%) | - |