Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| When Graph Structure Becomes a Liability: A Critical Re-Evaluation of Graph Neural Networks for Bitcoin Fraud Detection under Temporal Distribution Shift Saket Maganti Published: 2026-04-21Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-04-21 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E7 / R4 (96%) | - |
| AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation Fuli Feng, Hui Su, Qi Gu, Wentao Shi Published: 2026-04-20Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-20 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E11 / R5 (99%) | - |
| Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies Lorenz Brehme, Ruth Breu, Thomas Str枚hle Published: 2026-04-20Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-04-20 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E10 / R4 (98%) | - |
| MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models Ee-Peng Lim, Neemesh Yadav, Palakorn Achananuparp, Suhyun Lee Published: 2026-04-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E12 / R6 (95%) | - |
| Multilingual Training and Evaluation Resources for Vision-Language Models Andrea Zugarini, Daniela Baiamonte, Elena Fano, Leonardo Rigutini Published: 2026-04-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E13 / R5 (98%) | - |
| On the Importance and Evaluation of Narrativity in Natural Language AI Explanations David Martens, Mateusz Cedro Published: 2026-04-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E9 / R4 (98%) | - |
| TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering Chuhan Qiao, Haiming Huang, Jinglai Zheng Published: 2026-04-20Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-20 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R5 (98%) | - |
| WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models Chenchen Zhang, Chenyu Zhou, Dailin Li, Han Li Published: 2026-04-20Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-04-20 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E11 / R5 (98%) | - |
| Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier Jazmia Henry Published: 2026-04-19Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-19 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E12 / R7 (97%) | - |
| Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation Bing Zhao, Jianqiang Huang, Jiaxin Qi, Zhijiang Tang Published: 2026-04-19Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-04-19 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E12 / R9 (95%) | - |
| Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation Changgeon Ko, Hoyun Song, Huije Lee, Jisu Shin Published: 2026-04-18Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-18 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R4 (98%) | - |
| Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text Refael Shaked Greenfeld, Reut Tsarfaty Published: 2026-04-18Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-18 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R4 (97%) | - |
| From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text Van-Truong Le Published: 2026-04-17Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-17 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R5 (99%) | - |
| From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation Chen Xie, Feng Jiang, Jade Yang, Jasper Lu Published: 2026-04-17Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-04-17 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E14 / R9 (97%) | - |
| MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition Abdolamir Karbalaie, Eduardo Illueca-Fernandez, Farhad Abtahi, Fernando Seoane Published: 2026-04-17Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-17 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E17 / R10 (95%) | - |
| Spotlights and Blindspots: Evaluation Machine-Generated Text Detection Kailash Patil, Kevin Stowe Published: 2026-04-17Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-17 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R4 (95%) | - |
| AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment Ilya Dikman, Michael Winokur, Natan Levy, Oz Levy Published: 2026-04-16Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-04-16 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E6 / R3 (95%) | - |
| An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics ChengXiang Zhai, Miri Liu Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX Dongrui Liu, Haoyu Luo, Jing Shao, Tianyi Zhou Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models Emily Curl, Kofi Ampomah, Md Erfan, Sayanton Dibbo Published: 2026-04-16Area: cs.CVCitations: - Tags: adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | 2026-04-16 | cs.CV | adversarial-robustness, ai-safety, cscv, preprint, safety-evaluation | E17 / R6 (99%) | - |
| Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (93%) | - |
| Context Over Content: Exposing Evaluation Faking in Automated Judges Dhruv Kumar, Inderjeet Nair, Lu Wang, Manan Gupta Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation Chengkang Jiang, Fanyu Meng, He Zhu, Jiaheng Liu Published: 2026-04-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E4 / R3 (96%) | - |
| EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation Alessandra Piscitelli, Alessia Longo, Antonio Cristiano, Bianca Destro Castaniti Published: 2026-04-15Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-04-15 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R5 (95%) | - |
| Evaluation of Agents under Simulated AI Marketplace Dynamics Alireza Salemi, Fernando Diaz, Hamed Zamani, To Eun Kim Published: 2026-04-15Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-04-15 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Mamba-SSM with LLM Reasoning for Biomarker Discovery: Causal Feature Refinement via Chain-of-Thought Gene Evaluation Aijing Feng, Pushpa Kumar Balan Published: 2026-04-15Area: q-bio.QMCitations: - Tags: ai-safety, preprint, q-bioqm, safety-evaluation | 2026-04-15 | q-bio.QM | ai-safety, preprint, q-bioqm, safety-evaluation | E5 / R3 (96%) | - |
| Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities Bo Ding, Dawei Feng, Jiacheng Qin, JiaQi Liao Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Can AI Tools Transform Low-Demand Math Tasks? An Evaluation of Task Modification Capabilities Brenda L. Robles, Christian D. Schunn, Danielle S. Fox, Elizabeth DiPietro Brovey Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Development, Evaluation, and Deployment of a Multi-Agent System for Thoracic Tumor Board Faraah Bekheet, Joel Neal, Nerissa Ambers, Nigam H. Shah Published: 2026-04-14Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-04-14 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| GF-Score: Certified Class-Conditional Robustness Evaluation with Fairness Guarantees Arya Shah, Kaveri Visavadiya, Manisha Padala Published: 2026-04-14Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-04-14 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E7 / R3 (96%) | - |