Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 991-1000 of 1000+ papers (page 34 of 34)路 180 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 Priyatham Kattakinda, Soheil Feizi, Wenxiao Wang Published: 2026-07-15Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-15 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R8 (92%) | - |
| Evaluation Ability Does Not Imply Optimization Utility: LLM-as-a-Judge Signals in Closed-Loop Table Recognition Donghwan Kim Published: 2026-07-15Area: cs.CLCitations: 25 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-15 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E8 / R7 (96%) | 25 |
| Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration Justin Bronder Published: 2026-07-15Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-15 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E7 / R6 (91%) | - |
| Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System Javad Zarrin, P. George Lovell, Ruth Falconer, Teri Rumble Published: 2026-07-15Area: cs.CYCitations: 28 Tags: ai-safety, cscy, preprint, safety-evaluation | 2026-07-15 | cs.CY | ai-safety, cscy, preprint, safety-evaluation | E13 / R10 (92%) | 28 |
| Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents Blaine Nelson, Paul Kassianik, Yaron Singer Published: 2026-07-16Area: cs.CRCitations: 45 Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-07-16 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E16 / R14 (92%) | 45 |
| Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents Blaine Nelson, Paul Kassianik, Yaron Singer Published: 2026-07-16Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-07-16 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E10 / R7 (92%) | - |
| Can We Trust Item Response Theory for AI Evaluation? Han Jiang, Jinwen Luo, Sunbeom Kwon, Susu Zhang Published: 2026-07-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R6 (92%) | - |
| Can We Trust Item Response Theory for AI Evaluation? Han Jiang, Jinwen Luo, Sunbeom Kwon, Susu Zhang Published: 2026-07-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E24 / R19 (92%) | - |
| Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions Bingyang Wang, Huiqi Zou, Yijiang Li, Ziang Xiao Published: 2026-07-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E15 / R14 (91%) | - |
| Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications Leanne Tan, Rohan Jaggi, Roy Ka-Wei Lee, Shaun Khoo Published: 2026-07-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E15 / R10 (90%) | - |
| WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays Adnan Labib, Jiahui Wu, John Maurice Gayed, Qiao Wang Published: 2026-07-16Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-16 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E12 / R11 (94%) | - |
| AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets Ming Chen, Pranav Pai Published: 2026-07-17Area: cs.AICitations: - Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-17 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E8 / R6 (89%) | - |
| Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling Bo-An Chang, Yu-Chih Chen Published: 2026-07-17Area: cs.CVCitations: 34 Tags: ai-safety, alignment-training, cscv, preprint, safety-evaluation | 2026-07-17 | cs.CV | ai-safety, alignment-training, cscv, preprint, safety-evaluation | E12 / R12 (91%) | 34 |
| Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection Alejandro Seif, Anshu Singh Published: 2026-07-17Area: cs.CVCitations: - Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-17 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E13 / R12 (89%) | - |
| Building a Neural Network from Scratch: Implementation, Evaluation, and Optimization Yuanzhe Jia Published: 2026-07-18Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-18 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E16 / R15 (96%) | - |
| Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries Amber E. Osterholt, Bailee Rue, Bethany C. Bray, Krishna Riteshkumar Patel Published: 2026-07-18Area: cs.CLCitations: 16 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-18 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E14 / R16 (90%) | 16 |
| Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries Amber E. Osterholt, Bailee Rue, Bethany C. Bray, Krishna R. Patel Published: 2026-07-18Area: cs.CLCitations: 15 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-18 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E10 / R8 (89%) | 15 |
| ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments Alec Helbling, Alexander Greenhalgh, Duen Horng Chau, Elliott Faa Published: 2026-07-19Area: cs.CVCitations: 36 Tags: ai-safety, cscv, preprint, safety-evaluation | 2026-07-19 | cs.CV | ai-safety, cscv, preprint, safety-evaluation | E19 / R25 (92%) | 36 |
| An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation Shifeng Wu, Wenjie Cai, Xiangjin Meng, Zhanbo Li Published: 2026-07-19Area: cs.AICitations: 32 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E14 / R15 (90%) | 32 |
| A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents Yunze Han Published: 2026-07-19Area: cs.AICitations: 19 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E9 / R7 (94%) | 19 |
| Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment Ji Wang, Min Ji, Siyu Song, Wentao Liu Published: 2026-07-19Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, alignment-training, csai, preprint, safety-evaluation | E8 / R6 (91%) | - |
| Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment Ji Wang, Min Ji, Siyu Song, Wentao Liu Published: 2026-07-19Area: cs.AICitations: - Tags: ai-safety, alignment-training, csai, preprint, safety-evaluation | 2026-07-19 | cs.AI | ai-safety, alignment-training, csai, preprint, safety-evaluation | E10 / R8 (90%) | - |
| Estimating Rare Events in Language Models with Proper Evaluation Anqi Liu, Nikita Y. Parulekar Published: 2026-07-20Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-20 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E6 / R6 (90%) | - |
| Human Grounded Evaluation of Large Language Models for Optical Network Automation Carlos Natalino, Kiarash Rezaei, Omran Ayoub, Paolo Monti Published: 2026-07-20Area: cs.NICitations: - Tags: ai-safety, csni, preprint, safety-evaluation | 2026-07-20 | cs.NI | ai-safety, csni, preprint, safety-evaluation | E9 / R6 (90%) | - |
| Human Grounded Evaluation of Large Language Models for Optical Network Automation Carlos Natalino, Kiarash Rezaei, Omran Ayoub, Paolo Monti Published: 2026-07-20Area: cs.NICitations: 24 Tags: ai-safety, csni, preprint, safety-evaluation | 2026-07-20 | cs.NI | ai-safety, csni, preprint, safety-evaluation | E7 / R6 (91%) | 24 |
| JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models Jianguo Wu, Jingyu Zhang, Junyi Yao, Qingjia Huang Published: 2026-07-20Area: cs.CRCitations: 15 Tags: adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | 2026-07-20 | cs.CR | adversarial-robustness, ai-safety, cscr, preprint, safety-evaluation | E10 / R11 (87%) | 15 |
| WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting Dingli Liang, Jiayuan Rao, Shangzhe Di, Tianlin Gui Published: 2026-07-20Area: cs.AICitations: 41 Tags: ai-safety, csai, preprint, safety-evaluation | 2026-07-20 | cs.AI | ai-safety, csai, preprint, safety-evaluation | E10 / R7 (89%) | 41 |
| Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks Christophe Cerisara, Ga毛l Guibon, Guy Stephane Waffo Dzuyo, Luis Belmar-Letelier Published: 2026-07-21Area: cs.LGCitations: - Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-07-21 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E14 / R13 (92%) | - |
| Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges Disheng Liu, Jing Li, Tuo Liang, Yu Yin Published: 2026-07-21Area: cs.CLCitations: 150 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-21 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E15 / R12 (91%) | 150 |
| MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents Guofeng Zhang, Huaiyi Fang, Jianwei Lv, Jinyao Liu Published: 2026-07-21Area: cs.CLCitations: 25 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-07-21 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E7 / R6 (92%) | 25 |