Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AdaRubric: Task-Adaptive Rubrics for LLM Agent Evaluation Liang Ding Published: 2026-03-22Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-22 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R3 (98%) | - |
| Efficient Fine-Tuning Methods for Portuguese Question Answering: A Comparative Study of PEFT on BERTimbau and Exploratory Evaluation of Generative LLMs Caio Veloso Costa, Didier A. Vega-Oliveros, Lilian Berton, Mariela M. Nina Published: 2026-03-22Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-22 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R3 (97%) | - |
| BadminSense: Enabling Fine-Grained Badminton Stroke Evaluation on a Single Smartwatch Kai Chen, Pingchuan Ke, Taizhou Chen, Xingyu Liu Published: 2026-03-23Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-03-23 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E5 / R3 (97%) | - |
| BadminSense: Enabling Fine-Grained Badminton Stroke Evaluation on a Single Smartwatch Kai Chen, Pingchuan Ke, Taizhou Chen, Xingyu Liu Published: 2026-03-23Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-03-23 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E4 / R3 (98%) | - |
| Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation Hao Wang, Jie Ma, Jing Tao, Pinghui Wang Published: 2026-03-23Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-03-23 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E41 / R32 (97%) | - |
| Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation Hao Wang, Jie Ma, Jing Tao, Pinghui Wang Published: 2026-03-23Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-03-23 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E6 / R3 (96%) | - |
| SHAPE: Structure-aware Hierarchical Unsupervised Domain Adaptation with Plausibility Evaluation for Medical Image Segmentation Cong Cong, Leyi Wei, Linkuan Zhou, Qiangguo Jin Published: 2026-03-23Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-03-23 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R4 (97%) | - |
| Beyond Binary Correctness: Scaling Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks Abhishek Chandwani, Ishan Gupta Published: 2026-03-24Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Human-in-the-Loop Pareto Optimization: Trade-off Characterization for Assist-as-Needed Training and Performance Evaluation Harun Tolasa, Volkan Patoglu Published: 2026-03-24Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-03-24 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E6 / R3 (94%) | - |
| LLM Olympiad: Why Model Evaluation Needs a Sealed Exam Alham Fikri Aji, Jan Christian Blaise Cruz Published: 2026-03-24Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation Di Zhu, Zixuan Li Published: 2026-03-24Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (94%) | - |
| Off-Policy Evaluation and Learning for Survival Outcomes under Censoring Kohsuke Kubota, Mitsuhiro Takahashi, Yuta Saito Published: 2026-03-24Area: stat.MECitations: - Tags: ai-safety, preprint, safety-evaluation, statme | 2026-03-24 | stat.ME | ai-safety, preprint, safety-evaluation, statme | E5 / R3 (96%) | - |
| PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset Juhyeon Park, Sumin Yu, Taesup Moon Published: 2026-03-24Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-03-24 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E5 / R3 (94%) | - |
| Ran Score: a LLM-based Evaluation Score for Radiology Report Generation Bowen Liu, Danni Ai, Deqiang Xiao, Hongliang Sun Published: 2026-03-24Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| When AI Shows Its Work, Is It Actually Working? Step-Level Evaluation Reveals Frontier Language Models Frequently Bypass Their Own Reasoning Abhinaba Basu, Pavan Chakraborty Published: 2026-03-24Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-24 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R3 (95%) | - |
| Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search Ariel Felner, Carlos Hernandez, Hadar Peer, Oren Salzman Published: 2026-03-25Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-25 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R5 (98%) | - |
| Gaze patterns predict preference and confidence in pairwise AI image evaluation Ankur Samanta, Nikolas Papadopoulos, Paul Sajda, Sheng Bai Published: 2026-03-25Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-03-25 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E6 / R3 (97%) | - |
| Is Geometry Enough? An Evaluation of Landmark-Based Gaze Estimation Andrea Generosi, Daniele Agostinelli, Maura Mengoni, Thomas Agostinelli Published: 2026-03-25Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-03-25 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E7 / R3 (97%) | - |
| NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders Ilinka Ivanoska, Ivan Kitanovski, Katarina Trojachanec Dineva, Kostadin Mishev Published: 2026-03-25Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-03-25 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R3 (96%) | - |
| No Single Metric Tells the Whole Story: A Multi-Dimensional Evaluation Framework for Uncertainty Attributions Emily Schiller, Luca Longo, Marco Zullich, Teodor Chiaburu Published: 2026-03-25Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-03-25 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI Anna Kozlova, Hanna Plotnitskaya, Pavel Satalkin, Sergey Parfenyuk Published: 2026-03-26Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-26 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E4 / R3 (96%) | - |
| Does Explanation Correctness Matter? Linking Computational XAI Evaluation to Human Understanding Chao Zhang, Gregor Baer, Isel Grau, Pieter Van Gorp Published: 2026-03-26Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-03-26 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E5 / R3 (94%) | - |
| MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation Bing Zhao, Jinghang Wang, Renquan Lv, Shuang Wu Published: 2026-03-26Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-26 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation Chanyoung Park, Jayakumar Subramanian, Mehrab Tanjim, Sangwu Park Published: 2026-03-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following Bo Xu, Hongwei Feng, Licai Qi, Qianyu He Published: 2026-03-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (94%) | - |
| ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation Chen Tian, Haonan Sun, Lifei Rao, Qincheng Zhang Published: 2026-03-27Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-03-27 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E4 / R2 (95%) | - |
| Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards Ken-Tye Yong, Minh-Duong Nguyen, Nguyen H. Tran, Senura Hansaja Wanasekara Published: 2026-03-27Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-03-27 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E5 / R3 (96%) | - |
| Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles Dan Marshall, Denae Ford, Edward Cutrell, Ruoxi Shang Published: 2026-03-27Area: cs.HCCitations: - Tags: ai-safety, alignment-training, cshc, preprint, safety-evaluation | 2026-03-27 | cs.HC | ai-safety, alignment-training, cshc, preprint, safety-evaluation | E4 / R3 (96%) | - |
| LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications Alexandre Cristov茫o Maiorano Published: 2026-03-28Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-28 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R5 (98%) | - |
| Unsupervised Evaluation of Deep Audio Embeddings for Music Structure Analysis Axel Marmoret Published: 2026-03-28Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-03-28 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E6 / R3 (95%) | - |