@undefinedKi:DoorDash 刚刚公开了其新 AI 助手 Ask DoorDash 背后的完整结构。这是最清晰的…

X AI KOLs Following 新闻

摘要

DoorDash 分享了他们如何自动化评估 Ask DoorDash AI 助手,实现每天 2,000 次分级会话,并将测试时间从六小时缩短到 20 分钟,同时错误率减半。

DoorDash 刚刚公开了其新 AI 助手 Ask DoorDash 背后的完整结构。这是对这份无人宣传的 AI 工作最清晰的描绘 Ask DoorDash 是他们应用内的助手。你输入一个问题,它就会回答、查找内容并下单。迄今为止已有数百万次对话。 他们最初的问题:无法判断某个改动是否让它变得更好。质量检查意味着员工要手工写反馈,大约每天一条。一轮完整测试需要超过六个小时,所以几乎从不运行。 于是他们构建了一个为助手打分的系统: 1. 把好的答案应该是什么样,写成明确的检查项。 2. 从日志中重建真实会话,让评分者看到实际发生的情况。 3. 用模拟用户和冻结的工具响应进行回放,这样重跑时衡量的是你的改动,而不是其他因素。 4. 让模型来评分,但先用人类标注对它进行校准。 现在它每天给 2,000 个会话评分,一轮完整测试只需 20 分钟,而且在全国上线前错误率几乎下降了一半。 在 DoorDash,没有任何人的名片上写着“评估工程师”。但仍然需要有人编写评分标准并校准评判模型。这份工作正在抵达每一家发布模型的公司,外卖配送也不例外。 把这篇收藏起来
查看原文
查看缓存全文

缓存时间: 2026/08/06 00:34

DoorDash 刚刚发布了 Ask DoorDash 的完整架构,这是他们的新 AI 助手。这也是对这份没人宣传的 AI 工作最清晰的一次展示

Ask DoorDash 是 App 内的助手。你输入一个问题,它会回答、查找商品并下单。目前已经处理了数百万次对话。

他们最初的问题:无法判断一次改动是否让效果变好。检查质量意味着员工需要手动写反馈,大约一天一条。完整测试一轮需要六个多小时,所以几乎从不运行。

于是他们构建了一个系统,替他们给助手打分:

  1. 把“好的回答”写成显式检查项。

  2. 从日志中重建真实会话,让评分者看到实际发生了什么。

  3. 用模拟用户和冻结的工具响应回放这些会话,确保重跑时只衡量你的改动,而不受其他因素干扰。

  4. 让模型来打分,但先基于人工标注进行校准。

现在,它每天评估 2,000 个会话,完整测试一轮只需 20 分钟,错误率在全国上线前下降了近一半。

DoorDash 没有人名片上写着“评估工程师”。但仍然有人编写评分标准并校准评判模型。这项工作正在进入每一家发布模型的公司,外卖配送也不例外。

把这篇收藏起来。

相似文章

对话DoorDash首席人才官Mariana Garavaglia

OpenAI Blog

DoorDash首席人才官Mariana Garavaglia讨论了公司如何在整个组织范围内扩大AI采用,以赋予员工权力,通过采用指标和使用频率衡量AI素养,以及如何使用AI工具将自动化民主化到技术团队之外。

赋能团队更快地解锁洞察 - OpenAI

OpenAI Blog

OpenAI 开发了一个内部研究助手,它将仪表板与对话式 GPT-5 界面相结合,帮助团队在几分钟内分析数百万支持工单并生成洞察,而不是花费数周时间。该工具在整个团队中实现了数据分析民主化,允许非技术用户用自然语言提问并获得关于产品反馈、客户情感和趋势的可行性报告。