Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models Abhinav Mohanty, Brandon Behlendorf, Connor Harris, Gary Anthony Ackerman Published: 2026-07-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E16 / R15 (89%) | - |
| A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation Ali Mokhtari, Anselm Stark, Christoph Grani, Christoph Ryffel Published: 2026-07-13Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-13 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E14 / R9 (89%) | - |
| Calibrated Selective Prediction Using Deep Ensembles for ROI-Based Thyroid Nodule Ultrasound Classification Under Dataset Shift: A Retrospective Evaluation Md. Mohayminul Mukit, Md. Monir Hossain Shimul, Md. Sadibul Hasan Sadib, Rahmatul Kabir Rasel Sarker Published: 2026-07-13Area: eess.IVCitations: 28 Tags: ai-safety, eessiv, preprint, safety-evaluation | 2026-07-13 | eess.IV | ai-safety, eessiv, preprint, safety-evaluation | E8 / R8 (94%) | 28 |
| From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth Aleh Manchuliantsau Published: 2026-07-13Area: cs.AICitations: 22 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R5 (92%) | 22 |
| Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking Balaji Nagarajan, Faysal Satter, Karthik Nair, Niranjan Kumar M Published: 2026-07-13Area: cs.AICitations: 20 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E23 / R15 (91%) | 20 |
| The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation Chenglin Yu, Hongquan Gui, Hongxia Yang, Ming Li Published: 2026-07-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E15 / R14 (95%) | - |
| The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation Chenglin Yu, Hongquan Gui, Hongxia Yang, Ming Li Published: 2026-07-13Area: cs.AICitations: 15 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E19 / R15 (92%) | 15 |
| 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects Alvin Chan, Jihyeon Je, Jingshen Wang, Michael Spedden Published: 2026-07-12Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-12 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E12 / R10 (90%) | - |
| Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation Aoyu Zhang, Dongping Liu, Luyao Zhang Published: 2026-07-11Area: quant-phCitations: - Tags: ai-safety, preprint, quant-ph, safety-evaluation | 2026-07-11 | quant-ph | ai-safety, preprint, quant-ph, safety-evaluation | E10 / R8 (96%) | - |
| When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control Daming Luo Published: 2026-07-11Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-11 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R7 (95%) | - |
| A Production-Oriented Framework for Evaluation of SFX Generation Eric Granger, M茅lodie Desbos, Mohammadhadi Shateri, Yara Bahram Published: 2026-07-10Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-07-10 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E11 / R15 (94%) | - |
| L-MAD: A Systematic Evaluation of Multi-Agent Debate Structures in Legal Reasoning Dinh-Truong Do, Hoang-Trung Nguyen, Huu-Dong Nguyen, Le-Minh Nguyen Published: 2026-07-10Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-10 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R6 (92%) | - |
| A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation Chengju Liu, Haojie Dai, Jingwei Yang, Jinlong Li Published: 2026-07-09Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-07-09 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E7 / R7 (89%) | - |
| Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment Seongjae Kang, Taehyung Yu Published: 2026-07-09Area: cs.CLCitations: - Tags: ai-safety, alignment-training, cscl, preprint, safety-evaluation | 2026-07-09 | cs.CL | ai-safety, alignment-training, cscl, preprint, safety-evaluation | E9 / R6 (94%) | - |
| Psychological Competence as a Missing Dimension in AI Evaluation Alexis Michelle Abellar, Antoine Ferr猫re, Fendi Tsim, Marcos Economides Published: 2026-07-09Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-09 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E16 / R7 (92%) | - |
| VEGAS: Human-Aligned Video Caption Evaluation via Gaze Emad Barsoum, Po-han Li, Sandeep Chinchali, Shenghui Chen Published: 2026-07-09Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-09 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E8 / R8 (95%) | - |
| Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System Junde Lu, Xuefei Huang, Yiming Gai Published: 2026-07-08Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-08 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R7 (90%) | - |
| Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms Ezgi Korkmaz Published: 2026-07-08Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-08 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E12 / R8 (94%) | - |
| Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations Silvia Santano Published: 2026-07-08Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-08 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E17 / R15 (92%) | - |
| Vision Foundation Models in Radiology: A Scoping Review of Data, Methodology, Evaluation and Clinical Translation Alejandro Vergara-Richart, Almudena Fuster-Matanzo, Ana Jim茅nez-Pastor, 脕ngel Alberich-Bayarri Published: 2026-07-08Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-08 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E10 / R9 (93%) | - |
| AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation Andrey Podivilov, Maksim Parshin, Matvei Startsev, Roman Pozharskiy Published: 2026-07-07Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-07 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R14 (93%) | - |
| Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation Niels Potters, Theo Hofman Published: 2026-07-07Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-07 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R6 (94%) | - |
| Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning Akshay Arora, Ashutosh Aggarwal, Ishan Nigam, Krishna Singh Published: 2026-07-07Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-07 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R8 (90%) | - |
| Data-dependent Evaluations for Budgeted Submodular Maximization Jing Tang, Lejian Zhang, Xueyan Tang Published: 2026-07-07Area: cs.DSCitations: - Tags: ai-safety, csds, preprint, safety-evaluation | 2026-07-07 | cs.DS | ai-safety, csds, preprint, safety-evaluation | E10 / R12 (94%) | - |
| Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation Bin Li, Kan Li, Mingyang Zhao, Shenxi Liu Published: 2026-07-07Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-07 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E17 / R18 (93%) | - |
| PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages Abrorkhon Inomkhujaev, Alexander Fraser, Antonia Karamolegkou, Daryna Dementieva Published: 2026-07-07Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-07 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R7 (91%) | - |
| Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development Adam P. Burden, Kapil Singi, Majd Sakr, Rohit Mehra Published: 2026-07-07Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-07-07 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E12 / R11 (92%) | - |
| Reliable and Developer-Aligned Evaluation of Agents for Software Engineering Razvan Mihai Popescu Published: 2026-07-07Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-07-07 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E7 / R6 (89%) | - |
| EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems Danti Chen, Josh Fleischer, Kenneth Benavides Published: 2026-07-06Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-07-06 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E20 / R19 (94%) | - |
| Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation Anthony Marchiafava, Arefa Patwary, Atriya Sen, Sadia Kamal Published: 2026-07-06Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-06 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E15 / R8 (94%) | - |