Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops Byungho Choi, Hyundoo Park Published: 2026-07-27Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-27 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R7 (88%) | - |
| Novel Claim or D茅j脿 Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking Dacheng Wen, Francis C. M. Lau, Haorui He, Reynold Cheng Published: 2026-07-26Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-26 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | - | - |
| ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation Ahmed Haj Ahmed, Alvin Grissom Published: 2026-07-25Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-25 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | - | - |
| Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation John Kozak, Lisa Doake, Paul Simpson Published: 2026-07-25Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-25 | cs.AI | ai-safety, csai, preprint, safety-evaluation | - | - |
| Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation Jun Qin, Matthew Watson, Peter Grabowski, Yunting Song Published: 2026-07-24Area: cs.LGCitations: - Tags: ai-safety, alignment-training, cslg, preprint, safety-evaluation | 2026-07-24 | cs.LG | ai-safety, alignment-training, cslg, preprint, safety-evaluation | E8 / R7 (95%) | - |
| Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education Dominique Oberle, Friederike Eyssel, Karim Kaufmann, Stephan Vonschallen Published: 2026-07-24Area: cs.ROCitations: - Tags: ai-safety, csro, preprint, safety-evaluation | 2026-07-24 | cs.RO | ai-safety, csro, preprint, safety-evaluation | E8 / R6 (90%) | - |
| Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents Ishaan Bhimwal, Jona Ruthardt, Ryousuke Yamada, Suman Navaratnarajah Published: 2026-07-24Area: cs.AICitations: 1 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-24 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E13 / R11 (92%) | 1 |
| A Comparative Evaluation of Embeddings and LLMs in a Greek Book Publisher Setting - The CUP Dataset Dimitris Garefalakis, Dimitris Plexousakis, Katerina Papantoniou, Nikos Vardakis Published: 2026-07-23Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-23 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E18 / R10 (90%) | - |
| Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin Aini Li, Hai Hu, Liang Zhao, Zhiheng Qian Published: 2026-07-23Area: cs.CLCitations: 14 Tags: ai-safety, alignment-training, cscl, preprint, safety-evaluation | 2026-07-23 | cs.CL | ai-safety, alignment-training, cscl, preprint, safety-evaluation | E12 / R11 (91%) | 14 |
| Representing Entity Importance in AI Knowledge Systems: A Dual-Signal Framework of Audience Evaluation and Structural Authority Shen Xu Published: 2026-07-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-23 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R6 (91%) | - |
| What AI Red-Team Evaluations Can and Cannot Prove Bandana Kaur Published: 2026-07-23Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-23 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R5 (89%) | - |
| Reference-Free Evaluation of Reasoning in Open-Ended Question Answering Gregory E Dean, Guneet Singh Kohli, Maria Liakata, Michael Sejr Schlichtkrull Published: 2026-07-22Area: cs.CLCitations: 15 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-22 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E6 / R6 (94%) | 15 |
| SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data Tianming Lei, Xiaoxuan Qiao, Xiaoyang Li, Zenghui Zhou Published: 2026-07-22Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-22 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R7 (89%) | - |
| SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data Tianming Lei, Xiaoxuan Qiao, Xiaoyang Li, Zenghui Zhou Published: 2026-07-22Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-22 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E6 / R9 (91%) | - |
| Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation Junjie Gao, Kai Yang, Zhengxian Wu Published: 2026-07-22Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-22 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E14 / R13 (92%) | - |
| Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks Christophe Cerisara, Ga毛l Guibon, Guy Stephane Waffo Dzuyo, Luis Belmar-Letelier Published: 2026-07-21Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-21 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E14 / R13 (92%) | - |
| Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges Disheng Liu, Jing Li, Tuo Liang, Yu Yin Published: 2026-07-21Area: cs.CLCitations: 150 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-21 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E15 / R12 (91%) | 150 |
| MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents Guofeng Zhang, Huaiyi Fang, Jianwei Lv, Jinyao Liu Published: 2026-07-21Area: cs.CLCitations: 25 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-21 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R6 (92%) | 25 |
| MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents Guofeng Zhang, Huaiyi Fang, Jianwei Lv, Jinyao Liu Published: 2026-07-21Area: cs.CLCitations: - Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-21 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E9 / R8 (92%) | - |
| Estimating Rare Events in Language Models with Proper Evaluation Anqi Liu, Nikita Y. Parulekar Published: 2026-07-20Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-20 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E6 / R6 (90%) | - |
| Human Grounded Evaluation of Large Language Models for Optical Network Automation Carlos Natalino, Kiarash Rezaei, Omran Ayoub, Paolo Monti Published: 2026-07-20Area: cs.NICitations: - Tags: ai-safety, csni, preprint, safety-evaluation | 2026-07-20 | cs.NI | ai-safety, csni, preprint, safety-evaluation | E9 / R6 (90%) | - |
| Human Grounded Evaluation of Large Language Models for Optical Network Automation Carlos Natalino, Kiarash Rezaei, Omran Ayoub, Paolo Monti Published: 2026-07-20Area: cs.NICitations: 24 Tags: ai-safety, csni, preprint, safety-evaluation | 2026-07-20 | cs.NI | ai-safety, csni, preprint, safety-evaluation | E7 / R6 (91%) | 24 |
| JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models Jianguo Wu, Jingyu Zhang, Junyi Yao, Qingjia Huang Published: 2026-07-20Area: cs.CRCitations: 15 Tags: adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | 2026-07-20 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | E10 / R11 (87%) | 15 |
| WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting Dingli Liang, Jiayuan Rao, Shangzhe Di, Tianlin Gui Published: 2026-07-20Area: cs.AICitations: 41 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-20 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R7 (89%) | 41 |
| ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments Alec Helbling, Alexander Greenhalgh, Duen Horng Chau, Elliott Faa Published: 2026-07-19Area: cs.CVCitations: 36 Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-19 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E19 / R25 (92%) | 36 |
| An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation Shifeng Wu, Wenjie Cai, Xiangjin Meng, Zhanbo Li Published: 2026-07-19Area: cs.AICitations: 32 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E14 / R15 (90%) | 32 |
| A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents Yunze Han Published: 2026-07-19Area: cs.AICitations: 19 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R7 (94%) | 19 |
| Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment Ji Wang, Min Ji, Siyu Song, Wentao Liu Published: 2026-07-19Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, alignment-training, csai, preprint, safety-evaluation | E8 / R6 (91%) | - |
| Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment Ji Wang, Min Ji, Siyu Song, Wentao Liu Published: 2026-07-19Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, alignment-training, csai, preprint, safety-evaluation | E10 / R8 (90%) | - |
| Building a Neural Network from Scratch: Implementation, Evaluation, and Optimization Yuanzhe Jia Published: 2026-07-18Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-18 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E16 / R15 (96%) | - |