Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLM-Based Code Documentation Generation and Multi-Judge Evaluation Ikbel Ghrab, Ines Abdeljaoued-Tej, Ismail Khenissi, Mohamed Dhieb Published: 2026-05-11Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-05-11 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E8 / R6 (92%) | - |
| ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents Fouad Bousetouane Published: 2026-05-22Area: cs.MACitations: - Tags: adversarial-robustness, ai-safety, csma, preprint, safety-evaluation | 2026-05-22 | cs.MA | adversarial-robustness, ai-safety, csma, preprint, safety-evaluation | E12 / R10 (89%) | - |
| MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation Fuxin Jiang, Huawei Lin, Jie Song, Peng Li Published: 2026-05-26Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-05-26 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R7 (95%) | - |
| Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution Tarun Kota Published: 2026-05-29Area: cs.MACitations: 35 Tags: ai-safety, csma, preprint, safety-evaluation | 2026-05-29 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E10 / R6 (91%) | 35 |
| Performance Evaluation of Social Learning Ali H. Sayed, Felice Scala, Marco Carpentiero, Vincenzo Matta Published: 2026-06-08Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-08 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E8 / R10 (92%) | - |
| SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement Arjun Radhakrishna, Srishti Gautam, Sumit Gulwani Published: 2026-06-09Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-09 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E13 / R14 (96%) | - |
| Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator Badria Alfurhood, Balaji Kasula, Khulud Alawaji, Marius Silaghi Published: 2026-06-10Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-06-10 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E10 / R10 (92%) | - |
| Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines Yitao Li Published: 2026-06-13Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-13 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R4 (97%) | - |
| LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation Ayato Tsuboi, Hiroyasu Usami, Keisuke Hara, Naohiko Matsuda Published: 2026-06-14Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-14 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R4 (96%) | - |
| Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games Jeff Z. Pan, Jiaxin Bai, Linquan Wu, Mingen Zheng Published: 2026-06-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (96%) | - |
| Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators E. Wes Bethel, Shun Usami, Venkatram Vishwanath Published: 2026-06-14Area: cs.ARCitations: - Tags: ai-safety, csar, preprint, safety-evaluation | 2026-06-14 | cs.AR | ai-safety, csar, preprint, safety-evaluation | E9 / R5 (97%) | - |
| SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills Ismail Hossain, Md Jahangir Alam, Sai Puppala, Sajedul Talukder Published: 2026-06-14Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-06-14 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E11 / R5 (98%) | - |
| An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios Akriti Vij, Ee Wei Seah, Gabriel Waikin Loh Matienzo, Hankyul Baek Published: 2026-06-15Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-06-15 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E9 / R3 (98%) | - |
| Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations Yanan Long Published: 2026-06-15Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-15 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R4 (96%) | - |
| DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models Despoina Paschalidou, Jenny Schmalfuss, Jose M. Alvarez, Kashyap Chitta Published: 2026-06-15Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-06-15 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E8 / R5 (97%) | - |
| Human-on-the-Bridge: Scalable Evaluation for AI Agents Fouad Bousetouane Published: 2026-06-15Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-15 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E8 / R4 (95%) | - |
| Probing, Fusion, and Trustworthiness: A Systematic Evaluation of Foundation Model Representations for Multimodal Cancer Analysis Giuseppe Tripodi, Jingyu Hu, Reed Naidoo, Sarah F. McGough Published: 2026-06-15Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-06-15 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E9 / R4 (96%) | - |
| RecourseBench: A Modular Framework for Reproducible Algorithmic Recourse Evaluation Ahmed Abdelaal, Amir-Hossein Karimi, Chenghao Tan, Hashir Ahmed Published: 2026-06-15Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-15 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E13 / R7 (100%) | - |
| Vibe Coding Ate My Homework: An evaluation of AI approaches to greenfield software engineering and programming Callum Barbour Published: 2026-06-15Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-06-15 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E8 / R4 (97%) | - |
| AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows Bryan YP Yan, Guangxin Dai, Huizi Yu, Jiahui Niu Published: 2026-06-16Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-16 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E9 / R5 (97%) | - |
| DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack Chunyu Sun, Haitao Cui, Jiahao Zhang, Jie Chen Published: 2026-06-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R6 (100%) | - |
| Embedded Machine Learning for Microcontroller-Class Edge Devices: Data, Feature, Evaluation, and Deployment Pipelines Mostafa Darvishi Published: 2026-06-16Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-06-16 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E9 / R5 (96%) | - |
| How Inference Compute Shapes Frontier LLM Evaluation Cozmin Ududec, Harry Coppock, Jessica McFadyen, Kevin Wei Published: 2026-06-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E13 / R5 (97%) | - |
| MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation Jiamin Yan, Jiaxin Dai, Xiang Xiang, Zehang Wei Published: 2026-06-16Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-16 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E13 / R6 (99%) | - |
| Offline Preference-Based Trajectory Evaluation Fernando Diaz Published: 2026-06-16Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-06-16 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E10 / R4 (97%) | - |
| RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills A. Ali Heydari, Ahmed A. Metwally, Ben Graef, Chloe Zhang Published: 2026-06-16Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-06-16 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R4 (97%) | - |
| SEAGym: An Evaluation Environment for Self-Evolving LLM Agents Bin Liang, Changshui Zhang, Chuanyi Xue, Congjie Zheng Published: 2026-06-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-06-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R4 (97%) | - |
| A Clinician-Centered Pipeline for Annotation and Evaluation in Ultrasound AI Studies Fangyijie Wang, Gu茅nol茅 Silvestre, Haixia Huang, Jianjun Yu Published: 2026-06-17Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-06-17 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E9 / R5 (97%) | - |
| Better Adherence, Richer Context: A Field Evaluation of LLM-Powered Conversational Voice Diaries for Sleep Amama Mahmood, Bokyung Kim, Chien-Ming Huang, Honghao Zhao Published: 2026-06-17Area: cs.HCCitations: - Tags: ai-safety, cshc, preprint, safety-evaluation | 2026-06-17 | cs.HC | ai-safety, cshc, preprint, safety-evaluation | E8 / R5 (98%) | - |
| Gender Bias in LLM Hiring Decisions: Evidence from a Japanese Context and Evaluation of Mitigation Strategies Akshara Nadayanur Sathis Kanna, Gabriele Trovato, Machiko Hirota, Phan Xuan Tan Published: 2026-06-17Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-06-17 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E8 / R5 (97%) | - |