标签
Argo-Bench 提出了一个包含 210 项企业级数据科学任务的评测框架,构建于一个模拟外卖平台之上,该平台拥有一个包含 235 张表、75 亿行数据的 ERP 数据仓库。该框架测试的智能体需要在数据中进行导航并采取行动,而非仅仅生成 SQL。在 14 个前沿模型和开源权重模型中,表现最强的模型平均得分也仅为 59.5 分,凸显了数据智能体在真实场景下能力上的显著差距。
EvoOntology 引入了一种自进化本体层,封装为 MCP 服务器,以弥合代理-数据鸿沟,并提高在异构数据任务上的性能,如基准测试所示。
这条推文重点介绍了针对数据代理的新 DataSpace 基准,表明 harness 的选择在多模态模型和 agent harness 中显著影响准确率,最佳准确率达到 66.34%,且该基准尚未饱和。
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。
Databricks 推出了 Genie Ontology,这是一个基于 Unity Catalog 的自我改进上下文层,能够构建动态的业务定义知识图谱,并利用 OntoRank 解决定义冲突,减少文本到 SQL 的幻觉问题。
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
探讨从文本转SQL到自主数据代理的演变,比较了使用LangGraph自定义构建的代理与Snowflake Cortex Analyst、Databricks Genie和PowerBI Copilot等托管平台。