data-science-agents

Tag

Cards List
#data-science-agents

Skill-based Agentic Evaluation for Real-time Data Science Tasks

arXiv cs.AI · 2d ago Cached

This paper introduces a ground-truth-as-code framework for evaluating data-science agents on continuously updated data, achieving improved agreement with human evaluators and reduced token consumption.

0 favorites 0 likes
← Back to home

Submit Feedback