Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Anterior's Approach to Fairness Evaluation of Automated Prior Authorization System Anuj Iravane, Khadija Mahmoud, Sai P. Selvaraj Published: 2026-03-15Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-03-15 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E5 / R3 (95%) | - |
| An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc Barry Smith, Hong Zhang, Junchao Zhang, Le Chen Published: 2026-03-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (99%) | - |
| Seeking SOTA: Time-Series Forecasting Must Adopt Taxonomy-Specific Evaluation to Dispel Illusory Gains Blanka Horvath, Christoph Bergmeir, Daniel Schmidt, Frank Rudzicz Published: 2026-03-16Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-03-16 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E5 / R3 (93%) | - |
| SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration Bin Wu, Guangquan Xu, Qiannan Si, Tiejun Wu Published: 2026-03-16Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-03-16 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E4 / R3 (94%) | - |
| SlovKE: A Large-Scale Dataset and LLM Evaluation for Slovak Keyphrase Extraction David 艩teva艌谩k, Marek 艩uppa Published: 2026-03-16Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-16 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R3 (96%) | - |
| Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis Atin Ghosh, Daniel Dahlmeier, Harshavardhan Abichandani, Jiyuan Shen Published: 2026-03-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R4 (95%) | - |
| CoMAI: A Collaborative Multi-Agent Framework for Robust and Equitable Interview Evaluation Bin Zhang, Gengxin Sun, Liangyi Yin, Ruihao Yu Published: 2026-03-17Area: cs.MACitations: - Tags: ai-safety, csma, preprint, safety-evaluation | 2026-03-17 | cs.MA | ai-safety, csma, preprint, safety-evaluation | E6 / R4 (94%) | - |
| DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models Jiaqi Xiong, Qi Cao, Ruofan Liao, Sichen Liu Published: 2026-03-17Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-17 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R3 (98%) | - |
| DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models Jiaqi Xiong, Qi Cao, Ruofan Liao, Sichen Liu Published: 2026-03-17Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-17 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (95%) | - |
| Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models Aosong Feng, Chanjun Park, Irene Li, Jinghui Lu Published: 2026-03-17Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-17 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R4 (96%) | - |
| Who Benchmarks the Benchmarks? A Case Study of LLM Evaluation in Icelandic Bjarki 脕rmannsson, Finnur 脕g煤st Ingimundarson, Iris Edda Nowenstein, Steinunn Rut Fri冒riksd贸ttir Published: 2026-03-17Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-17 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R4 (96%) | - |
| Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients Abby Pandya, April S Liang, Jane Wang, Jason Hom Published: 2026-03-18Area: cs.CYCitations: - Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-03-18 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E5 / R3 (97%) | - |
| Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails Gregory N. Frank Published: 2026-03-18Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint, safety-evaluation | 2026-03-18 | cs.LG | ai-safety, alignment-training, cslg, preprint, safety-evaluation | E8 / R4 (98%) | - |
| Machine Learning for Network Attacks Classification and Statistical Evaluation of Machine Learning for Network Attacks Classification and Adversarial Learning Methodologies for Synthetic Data Generation Christos Douligeris, Iakovos-Christos Zarkadis Published: 2026-03-18Area: cs.CRCitations: - Tags: adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | 2026-03-18 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | E5 / R3 (97%) | - |
| MolRGen: A Training and Evaluation Setting for De Novo Molecular Generation with Reasonning Models Ismail Ben Ayed, Maxime Darrin, Pablo Piantanida, Philippe Formont Published: 2026-03-18Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-03-18 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E5 / R3 (93%) | - |
| The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition Alvin Rajkomar, Angela Lai, Lily Peng, Pavan Sudarshan Published: 2026-03-18Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-03-18 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E5 / R3 (96%) | - |
| UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models Boryeong Cho, Hojung Jung, Jaehyun Kwak, Juhyeong Kim Published: 2026-03-18Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-03-18 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E5 / R3 (97%) | - |
| Benchmarking PDF Parsers on Table Extraction with LLM-based Semantic Evaluation Janis Keuper, Pius Horn Published: 2026-03-19Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-03-19 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E6 / R3 (94%) | - |
| ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation Haochen Zhao, Shaoyang Cui Published: 2026-03-19Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-03-19 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E5 / R4 (97%) | - |
| ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs Abhinaba Basu, Pavan Chakraborty Published: 2026-03-19Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-19 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (98%) | - |
| Is Evaluation Awareness Just Format Sensitivity? Limitations of Probe-Based Evidence under Controlled Prompt Structure Viliana Devbunova Published: 2026-03-19Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-19 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E5 / R3 (94%) | - |
| ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability Chun-Yi Lee, Jay Chiehen Liao, Shang-Tse Chen, Shao-Yuan Lo Published: 2026-03-20Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-03-20 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E34 / R31 (97%) | - |
| An Industrial-Scale Retrieval-Augmented Generation Framework for Requirements Engineering: Empirical Evaluation with Automotive Manufacturing Data Muhammad Khalid, Yilmaz Uygun Published: 2026-03-20Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-03-20 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E6 / R3 (96%) | - |
| An Industrial-Scale Retrieval-Augmented Generation Framework for Requirements Engineering: Empirical Evaluation with Automotive Manufacturing Data Muhammad Khalid, Yilmaz Uygun Published: 2026-03-20Area: cs.SECitations: - Tags: ai-safety, csse, preprint, safety-evaluation | 2026-03-20 | cs.SE | ai-safety, csse, preprint, safety-evaluation | E43 / R36 (96%) | - |
| CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation Du-Seong Chang, Haejun Yoo, Insung Lee, Myoung-Wan Koo Published: 2026-03-20Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint, safety-evaluation | 2026-03-20 | cs.SD | ai-safety, cssd, preprint, safety-evaluation | E5 / R3 (97%) | - |
| Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation Richard J. Young Published: 2026-03-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R4 (98%) | - |
| Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation Richard J. Young Published: 2026-03-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R4 (99%) | - |
| Permutation-Consensus Listwise Judging for Robust Factuality Evaluation Elsa Fan, Justin Tang, Nathan Huang, Tianyi Huang Published: 2026-03-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E33 / R25 (94%) | - |
| Span-Level Machine Translation Meta-Evaluation Eric Morales Agostinho, Hugo Zaragoza, Stefano Perrella Published: 2026-03-20Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-03-20 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E4 / R3 (94%) | - |
| RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation Eugene Agichtein, Kaustubh D. Dhole Published: 2026-03-21Area: cs.IRCitations: - Tags: ai-safety, csir, preprint, safety-evaluation | 2026-03-21 | cs.IR | ai-safety, csir, preprint, safety-evaluation | E5 / R3 (94%) | - |