当前AI最大的瓶颈在于部署层的模型迭代

Reddit r/artificial 新闻

摘要

文章指出,当前生产环境中AI的最大瓶颈并非初始模型部署,而是持续的迭代周期——将生产使用(推理日志、用户反馈)转化为用于微调和重新部署的数据集。文章强调了构建集成反馈循环而非一次性项目的重要性。

在观察生产环境中的AI系统时,我注意到一个现象:部署第一个模型已经不再是难事。大多数团队能相当快速地构建AI应用,比如支持机器人、文档助手或代理工作流。更棘手的问题出现在几周之后。真实用户的行为与基准数据集截然不同。他们使用内部术语、提出不完整的问题、上传杂乱无章的文件,并以评估时无人预料到的方式与系统交互。随着使用量的增长,你会开始看到一些模式: * 某些问题始终产生较弱的响应。 * 原始训练数据中未出现的新产品术语被引入。 * 用户发现了测试时从未出现的边缘情况。 * 模型在某些工作流中表现良好,但在另一些中则表现不佳。 问题在于,大多数AI系统并未从这些现象中学习。推理日志停留在某个系统中,训练数据集存放在另一个地方,微调流水线又在别处,评估则使用不同的工具。因此,每一次模型改进周期都成了一个独立的项目。这是当前生产环境中AI的最大瓶颈。**不是训练,而是模型迭代。** 训练固然关键,但更重要的是:你是否能利用生产使用数据,识别失败模式,将其转化为数据集,改进模型,重新部署,并在不每次都重建整个工作流的情况下重复这一过程? 那些从AI中获取最大价值的团队似乎正在构建反馈循环:生产流量 → 数据集整理 → 后训练 → 评估 → 重新部署。然后不断重复这一循环。 我最近在一个保险聊天用例中尝试了这种方法,我的流水线大致如下:https://preview.redd.it/kdo9vytzfi6h1.png?width=1272&format=png&auto=webp&s=03d9799ace5a567eafd004a1d141084af6ee5afb 我最近在研究像Data Lab这样的平台如何处理这个问题,有趣的部分并非微调本身,而是将推理日志、数据集、后训练和部署视为同一个迭代循环的一部分,而非独立的系统。 你真正在生产对话、代理轨迹和用户反馈的基础上改进模型,还是大多数微调工作仍作为一次性项目进行?我在我的新闻通讯中对此作了详细说明[这里](https://mranand.substack.com/p/most-crucial-ai-bottleneck-iteration)。
查看原文

相似文章

模型越来越快,项目却未见提速。

Reddit r/AI_Agents

对于小企业而言,部署AI的实际瓶颈不再是模型速度,而是建立信任和界定范围——将老板已熟知的重复性决策移交出去,是切实可行的第一步。