Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Human-on-the-Bridge: Scalable Evaluation for AI Agents Fouad Bousetouane Published: 2026-06-15Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-15 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E8 / R4 (95%) | - |
| Probing, Fusion, and Trustworthiness: A Systematic Evaluation of Foundation Model Representations for Multimodal Cancer Analysis Giuseppe Tripodi, Jingyu Hu, Reed Naidoo, Sarah F. McGough Published: 2026-06-15Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-06-15 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E9 / R4 (96%) | - |
| RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation Ahmed Abdelaal, Amir-Hossein Karimi, Chenghao Tan, Hashir Ahmed Published: 2026-06-15Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-15 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E13 / R7 (100%) | - |
| Vibe Coding Ate My Homework: An evaluation of AI approaches to greenfield software engineering and programming Callum Barbour Published: 2026-06-15Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-06-15 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E8 / R4 (97%) | - |
| LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation Ayato Tsuboi, Hiroyasu Usami, Keisuke Hara, Naohiko Matsuda Published: 2026-06-14Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-14 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R4 (96%) | - |
| Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games Jeff Z. Pan, Jiaxin Bai, Linquan Wu, Mingen Zheng Published: 2026-06-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (96%) | - |
| Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators E. Wes Bethel, Shun Usami, Venkatram Vishwanath Published: 2026-06-14Area: cs.ARCitations: - Tags: ai-safety, csar, preprint, safety-evaluation | 2026-06-14 | cs.AR | ai-safety, csar, preprint, safety-evaluation | E9 / R5 (97%) | - |
| SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills Ismail Hossain, Md Jahangir Alam, Sai Puppala, Sajedul Talukder Published: 2026-06-14Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-06-14 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E11 / R5 (98%) | - |
| Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines Yitao Li Published: 2026-06-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R4 (97%) | - |
| Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator Badria Alfurhood, Balaji Kasula, Khulud Alawaji, Marius Silaghi Published: 2026-06-10Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-06-10 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E10 / R10 (92%) | - |
| SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement Arjun Radhakrishna, Srishti Gautam, Sumit Gulwani Published: 2026-06-09Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-09 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E13 / R14 (96%) | - |
| Performance Evaluation of Social Learning Ali H. Sayed, Felice Scala, Marco Carpentiero, Vincenzo Matta Published: 2026-06-08Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-08 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E8 / R10 (92%) | - |
| Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution Tarun Kota Published: 2026-05-29Area: cs.MACitations: 35 Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-29 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E10 / R6 (91%) | 35 |
| MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation Fuxin Jiang, Huawei Lin, Jie Song, Peng Li Published: 2026-05-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-05-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R7 (95%) | - |
| ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents Fouad Bousetouane Published: 2026-05-22Area: cs.MACitations: - Tags: adversarial-robustness, ai-safety, csma, preprint, safety-evaluation | 2026-05-22 | cs.MA | adversarial-robustness, ai-safety, csma, preprint, safety-evaluation | E12 / R10 (89%) | - |
| LLM-Based Code Documentation Generation and Multi-Judge Evaluation Ikbel Ghrab, Ines Abdeljaoued-Tej, Ismail Khenissi, Mohamed Dhieb Published: 2026-05-11Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-05-11 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E8 / R6 (92%) | - |
| SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis Arti Singh, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde Published: 2026-05-10Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-10 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E20 / R21 (91%) | - |
| Coordination Matters: Evaluation of Cooperative Multi-Agent Reinforcement Learning Afsaneh Doryab, Maria Ana Cardei, Matthew Landers Published: 2026-05-07Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-07 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E9 / R8 (93%) | - |
| FlowEval: Reference-based Evaluation of Generated User Interfaces Eldon Schoop, Jason Wu, Jeffrey Nichols, Priyan Vaithilingam Published: 2026-05-05Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-05 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E13 / R11 (91%) | - |
| Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus Andrei Zhukov, Anirudh Narayanan, Anna Purcarea, Christopher Zirn Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (95%) | - |
| All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation Chen-An Li, Chih-Kai Yang, Hung-yi Lee, Ke-Han Lu Published: 2026-04-27Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-04-27 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E10 / R4 (100%) | - |
| An empirical evaluation of the risks of AI model updates using clinical data: stability, arbitrariness, and fairness Carlos Castillo, Ioannis Bilionis, Luis Fernandez-Luque, Ricardo C. Berrios Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R4 (97%) | - |
| A systematic evaluation of vision-language models for observational astronomical reasoning tasks Hengxiao Guo, Wenke Ren, Wenwen Zuo, Xiaoman Zhang Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R3 (98%) | - |
| Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters Aaryan Shah, Aida Rutledge, Alexia Downs, Andrew Hines Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (94%) | - |
| Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs Ananya Joshi, Rhea Makkuni Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (97%) | - |
| CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation Bowen Shi, Jianpeng Zhang, Ling Zhang, Ruifeng Yuan Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (98%) | - |
| Failure-Centered Runtime Evaluation for Deployed Trilingual Public-Space Agents M. Meng Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (95%) | - |
| K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology Cheongwoong Kang, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi Published: 2026-04-27Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-27 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R5 (96%) | - |
| Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop Adithi Satish, Ashmi Banerjee, Wolfgang W枚rndl, Yashar Deldjoo Published: 2026-04-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R4 (98%) | - |
| QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering Junyeong Kim, Woojun Jung Published: 2026-04-27Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-27 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E8 / R6 (98%) | - |