TuiML: 面向 AI 代理的机器学习
摘要
TuiML 是一款专为 AI 代理设计的机器学习库,具备自描述组件和验证工作流,旨在提升代理在 ML 任务中的自主性和可重复性。
arXiv:2609.17984v1 Announce Type: new
摘要:诸如 Weka 和 scikit-learn 的机器学习库是为人类程序员设计的。语言模型代理现在通过回忆 API 并编写代码来使用这些相同的库,这种方法隐藏了库的功能,将错误延迟到运行时,并在任务间丢失实验状态。我们推出了 TuiML,一个专为 AI 代理构建的独立机器学习库,包含监督学习、无监督学习、时间序列、数据处理、调优和评估任务的原生算法。每个组件通过机器可读的元数据和参数模式自我描述,因此代理可以搜索库、检查组件、组合验证工作流,并注册新组件,使其依次可被发现。每次调用都经过验证、设种子和追踪,会话可导出为可运行的笔记本,使实验在构建上可重复。一个规范层驱动模型上下文协议(MCP)、代理框架适配器、Python API、CLI 和本地模型服务,同时数据和模型从不离开机器。基准测试显示 TuiML 在预测能力上与 scikit-learn 和 Weka 保持竞争力。虽然对人类用户来说看起来像传统库,但 TuiML 首先为代理设计,允许它们自主读取、扩展和操作机器学习。TuiML 是开源的,文档位于 https://tuiml.ai。
查看缓存全文
缓存时间: 2026/09/17 09:29
# TuiML:面向AI智能体的机器学习库 来源:https://arxiv.org/html/2609.17984 尼尔什·维尔马 nilesh\.verma@waikato\.ac\.nz 尼克·林 nick\.lim@waikato\.ac\.nz 隶属机构:新西兰汉密尔顿3216怀卡托大学AI研究所 阿尔伯特·比费特 albert\.bifet@waikato\.ac\.nz 隶属机构:新西兰汉密尔顿3216怀卡托大学AI研究所 / 法国巴黎综合理工学院电信巴黎学院LTCI,91120帕莱索玛格丽特·佩雷广场19号 伯恩哈德·普法林格 bernhard\.pfahringer@waikato\.ac\.nz 隶属机构:新西兰汉密尔顿3216怀卡托大学AI研究所 ###### 摘要 Weka和scikit-learn等机器学习库最初是为人类程序员设计的。语言模型智能体现在通过记忆API并编写代码的方式使用这些相同的库,这种隐藏库功能、将错误延迟到运行时暴露,并且在轮次间丢失实验状态的做法存在缺陷。我们提出TuiML,一个专为AI智能体构建的自包含机器学习库,提供涵盖监督学习、无监督学习、时间序列、数据处理、调优和评估任务的原生算法。每个组件都通过机器可读的元数据和参数模式进行自我描述,使智能体能够搜索库、检查组件、组合经过验证的工作流,并注册新组件使其可被发现。每次调用都经过验证、设种子并追踪,会话可导出为可运行的笔记本,从而在设计上实现实验的可重复性。一个规范层驱动模型上下文协议(MCP)、智能体框架适配器、Python API、命令行界面和本地模型服务,同时数据和模型不会离开本地机器。基准测试显示TuiML在预测性能上与scikit-learn和Weka具有竞争力。虽然对人类用户而言它看似一个传统库,但TuiML首先为智能体设计,允许它们自主读取、扩展和操作机器学习。TuiML是开源的,文档位于https://tuiml.ai/。 ††短标题:TuiML:面向AI智能体的机器学习库 / Verma, Lim, Bifet 和 Pfahringer ††首页:1 ††编辑:无 ###### 关键词 AI智能体,机器学习库,MCP,智能体式机器学习工作流 ## 1引言 机器学习库的编写始终假定特定的用户群体,即阅读文档、学习API并手动编写脚本的程序员。Weka、scikit-learn及其后续版本都共享这一假设。然而,操作这些相同库的语言模型智能体打破了这一假设,且失败案例是可衡量的。在MLE-bench中报告的最强系统仅在16.9%的竞赛中达到Kaggle铜牌水平(Chan等,2025),MLAgentBench指出幻觉和长期规划是持续存在的失败模式(Huang等,2024),而被要求记忆大型接口的智能体会发明看似合理但不存在的API调用,这一问题促使了对实时文档检索的研究(Patil等,2024)。这种错配是结构性的,因为智能体被期望在内存中持有从未为此设计的接口。 我们提出TuiML,一个从头开始专为AI智能体设计的综合性机器学习库,在库的层面(而非智能体层面)解决这一错配。TuiML不是要求智能体生成整个程序,而是将机器学习操作暴露为类型化、可发现的动作,基于一个简单的原则:当库能够自我描述时,智能体无需记忆库。每个算法都是一个由模式描述的动作,智能体可以直接调用。可查询的注册表使组件可通过任务、数据形状或约束被发现。一个经过验证的执行层,配合结构化错误、记录的种子和可重放的笔记本单元格,使智能体驱动的实验在设计上变得可信且可重复。模型上下文协议(MCP)标准化了工具发现和基于模式的调用(Anthropic,2024),而TuiML为这些调用提供了机器学习语义、持久状态和本地运行时。该设计建立在scikit-learn(Pedregosa等,2011;Buitinck等,2013)、Weka(Hall等,2009)、MOA(Bifet等,2010)和River(Montiel等,2021)的接口规范之上。它支持运行时发现、机器可读的参数模式和任务级执行。与将智能体动作整合为可执行代码的方法(Wang等,2024)不同,TuiML将动作约束为经过验证的调用,在保留Python接口(代码执行智能体可通过此接口导入组件)的同时,消除了静默的参数错误。 ## 2设计与架构 图1:TuiML通过一个类型化契约将智能体规划与机器学习执行分离,同时数据和拟合模型保持在本地。实线箭头显示正向路径,智能体发现并调用MCP工具,由执行层验证并在本地运行。虚线箭头显示返回路径,指标、模型标识符、追踪信息和可重放的笔记本单元格流回智能体。 TuiML中的每个组件通过注册表名称和构造函数参数字典来寻址,这是算法、转换和度量标准共享的单一方案。注册表将每个名称解析为其实现,并暴露其元数据和参数的JSON模式,扩展了传统库(Buitinck等,2013)的统一估计器协议,增加了运行时发现功能。由于发现和执行使用同一个注册表,新注册的组件会立即变得可搜索和可被智能体调用,而无效名称、参数位置错误或不支持的估计器会被结构化错误拒绝,而非静默替换。如图1所示,智能体通过MCP客户端连接,发现可用的TuiML工具及其模式,并提交覆盖完整实验周期的工作流规范,从数据检查和预处理到训练、调优、评估、服务和笔记本导出。智能体决定尝试什么,TuiML决定实验如何实例化和记录。 图2:智能体与TuiML的会话。一个请求解析为类型化调用,用于发现、基准测试、调优和提供服务模型,TuiML对每一步进行验证、设种子和记录。 图2追踪了一个代表性会话,其中智能体查询注册表以获取候选分类器,在交叉验证下对它们进行基准测试,调优优胜者,并提供拟合模型的服务,所有参数在任何模型拟合之前都经过验证。可重复性源于相同的契约。TuiML记录每个成功的调用及其种子和模型谱系,并将序列导出为可执行的笔记本单元格,因此每个会话在设计上都能生成一个可运行的工件(Pineau等,2021)。紧凑的JSON Lines追踪保留了时间戳、参数、持续时间和状态,而不复制大型数组。数据集和拟合模型永远不会离开机器,智能体接收的是模式和结构化摘要,而非原始数据。 ## 3实现与评估 TuiML是一个基于NumPy(Harris等,2020)构建的Python 3.10+库,其性能关键内核通过pybind11由C++编译而成。它提供分类、回归、聚类、关联挖掘、异常检测和时间序列建模,以及预处理、特征工程、度量标准、统计测试、调优和报告功能。可选的scikit-learn(Pedregosa等,2011)和CapyMOA(Gomes等,2025)学习器通过命名空间包装器暴露。与规定搜索策略的AutoML系统(Feurer等,2015;Trirat等,2025)不同,TuiML提供了一个稳定的操作空间,此类系统可以在此基础上构建。为评估运行时性能,我们在托管于OpenML(Vanschoren等,2014)上的51个TabArena v0.1数据集(Erickson等,2025)上比较了TuiML、scikit-learn和Weka共有的13种算法,超参数和十折划分在各框架间对齐,运行在隔离的单线程进程中执行。如图3所示,TuiML实现了与scikit-learn和Weka相当的准确率,同时在运行时间和内存消耗方面具有竞争力,这证明了面向智能体的接口能够协调出具有竞争力的运行时性能。 图3:在51个TabArena数据集上的匹配结果,平均3318次运行。准确率涵盖2587次分类运行,Weka内存包括其JVM基线。 ## 4结论 TuiML提供了一个自我描述的机器学习库,其中组件是可发现的、调用是经过验证的、实验是可追踪的,后端是涵盖分类、回归、聚类、异常检测、关联挖掘和时间序列建模的原生、高性能实现。文档、教程、贡献指南和完整的基准测试协议可在https://tuiml.ai/获取。该库附带全面的测试套件和适用于Linux、macOS和Windows的跨平台构建版本。TuiML目前仍是Alpha软件,语法有效的调用仍可能编码统计上不适当的实验,因此结果需要通常的审查。未来的工作包括在相同模型和预算下,对模式引导调用与自由形式代码进行受控比较,更广泛的算法覆盖范围,以及工具选择准确性和令牌成本的测量。我们预期随着智能体接口的成熟,TuiML将作为研究和实际应用的综合工具不断发展。 ###### 致谢-资助披露。 TuiML在怀卡托大学人工智能研究所Te Ipu o te Mahara开发,建立在Weka在那里确立的开放机器学习软件传统之上。这项工作部分由TAIAO计划(用于高级开放环境科学的时间演进数据科学与人工智能)资助,该计划由新西兰商业、创新和就业部资助。 ## 参考文献 - Anthropic(2024)Anthropic引入模型上下文协议。注:https://www.anthropic.com/news/model-context-protocol 访问日期2026年8月12日 - Bifet等(2010)A. Bifet, G. Holmes, R. Kirkby, 和 B. Pfahringer MOA: 大规模在线分析。机器学习研究杂志 11, 页 1601–1604. - Buitinck等(2013)L. Buitinck, G. Louppe, M. Blondel, F. Pedregosa, A. Mueller, O. Grisel, V. Niculae, P. Prettenhofer, A. Gramfort, J. Grobler, R. Layton, J. VanderPlas, A. Joly, B. Holt, 和 G. Varoquaux 机器学习软件的API设计:来自scikit-learn项目的经验。在ECML PKDD研讨会:数据挖掘和机器学习语言,页 108–122. - Chan等(2025)J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan, A. Madry, 和 L. Weng MLE-bench:在机器学习工程上评估机器学习智能体。在国际学习表征会议。 - Erickson等(2025)N. Erickson, L. Purucker, A. Tschalzev, D. Holzmüller, P. Desai, D. Salinas, 和 F. Hutter TabArena:一个针对表格数据机器学习的动态基准。在神经信息处理系统进展,数据集与基准轨道。 - Feurer等(2015)M. Feurer, A. Klein, K. Eggensperger, J. T. Springenberg, M. Blum, 和 F. Hutter 高效且鲁棒的自动机器学习。在神经信息处理系统进展,第28卷。 - Gomes等(2025)H. M. Gomes, A. Lee, N. Gunasekara, Y. Sun, G. W. Cassales, J. J. Liu, M. Heyden, V. Cerqueira, M. Bahri, Y. S. Koh, B. Pfahringer, 和 A. Bifet CapyMOA:Python中用于数据流的高效机器学习。arXiv预印本 arXiv:2502.07432。 - Hall等(2009)M. Hall, E. Frank, G. Holmes, B. Pfahringer, P. Reutemann, 和 I. H. Witten WEKA数据挖掘软件:更新。SIGKDD探索 11(1), 页 10–18. - Harris等(2020)C. R. Harris, K. J. Millman, S. J. van der Walt, 等。使用NumPy进行数组编程。自然 585(7825), 页 357–362. - Huang等(2024)Q. Huang, J. Vora, P. Liang, 和 J. Leskovec MLAgentBench:评估语言智能体在机器学习实验中的表现。在第41届国际机器学习会议论文集。 - Montiel等(2021)J. Montiel, M. Halford, S. M. Mastelini, G. Bolmier, R. Sourty, R. Vaysse, A. Zouitine, H. M. Gomes, J. Read, T. Abdessalem, 和 A. Bifet River:Python中用于流数据的机器学习。机器学习研究杂志 22(110), 页 1–8. - Patil等(2024)S. G. Patil, T. Zhang, X. Wang, 和 J. E. Gonzalez Gorilla:连接大规模API的大语言模型。在神经信息处理系统进展,第37卷,页 126544–126565。 - Pedregosa等(2011)F. Pedregosa, G. Varoquaux, A. Gramfort, V. Michel, B. Thirion, O. Grisel, M. Blondel, P. Prettenhofer, R. Weiss, V. Dubourg, J. Vanderplas, A. Passos, D. Cournapeau, M. Brucher, M. Perrot, 和 E. Duchesnay Scikit-learn:Python中的机器学习。机器学习研究杂志 12, 页 2825–2830。 - Pineau等(2021)J. Pineau, P. Vincent-Lamarre, K. Sinha, V. Larivière, A. Beygelzimer, F. d’Alché-Buc, E. Fox, 和 H. Larochelle 提高机器学习研究的可重复性(来自NeurIPS 2019可重复性项目的报告)。机器学习研究杂志 22(164), 页 1–20。 - Trirat等(2025)P. Trirat, W. Jeong, 和 S. J. Hwang AutoML-Agent:用于全流水线AutoML的多智能体LLM框架。在第42届国际机器学习会议论文集。 - Vanschoren等(2014)J. Vanschoren, J. N. van Rijn, B. Bischl, 和 L. Torgo OpenML:面向科学的开放机器学习网络。机器学习研究杂志 15, 页 3183–3186。 - Wang等(2024)Y. Wang, S. Joty, X. Lu, J. Li, N. F. Liu, 和 C. Xiao RAPTOR:基于树的检索增强生成。在2024年神经信息处理系统会议论文集。 - arXiv(2024)arXiv 2609.17984。
相似文章
@dair_ai: 这是提高您的智能体工作流最有效的方法之一。如果您正在构建计算机使用代理,这…
任务模型归纳(TMI)是一种从原始计算机使用痕迹中归纳结构化任务模型的方法,将代理性能提升30%,并为现实世界工作流提供可审计、可重用的技能。
Timmy-TUI
Timmy-TUI 是一款本地优先的智能体信任控制台,为管理 AI 智能体提供安全的本地工作空间。
bytedance/UI-TARS-desktop
ByteDance 发布了 TARS,这是一个多模态 AI 智能体技术栈,包含 Agent TARS(基于 CLI/Web UI 的通用 AI 智能体,支持 GUI、浏览器和终端任务)和 UI-TARS Desktop(由 UI-TARS 模型驱动的原生桌面应用,用于本地和远程计算机/浏览器自动化)。该技术栈将多模态 LLM 与 MCP 工具相结合,实现类人任务处理能力。
UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理
UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。
@tavilyai: 想知道如何使用 Tavily 让您的智能体更上一层楼?我们整理了一整页示例…
Tavily 展示了如何利用其实时网络数据 API 来增强 AI 智能体,涵盖销售、招聘、产品、金融、法律、风险、安全、旅行以及开源研究等多个领域。