Uber Eats 如何使用自调优 AI 多智能体系统(以及为何重要)

Reddit r/AI_Agents 新闻

摘要

Uber Eats 描述其自调优多智能体 AI 系统,用于自动修复商家照片,使用路由、编辑、QA 智能体,配合集中式日志记录,以及一个自主的诊断智能体(Diagnoser Agent),在通过黄金基准测试后自动重写提示并自动部署。

Uber Eats 在 10,000 多个城市处理数百万张食物照片。为了修复质量不佳的商家照片,同时避免生成看起来假兮兮的“AI 生成垃圾”,他们构建了一个自动化多智能体架构。以下是它的底层工作原理:1. 架构(“瑞士奶酪”模型)Uber 没有使用一个巨型 AI 模型,而是将专业智能体分层堆叠:路由智能体(Router Agent):决定是修复照片还是跳过它(针对高召回率进行优化,确保坏照片不会漏掉)。编辑与 QA 智能体:持续循环运行,编辑照片、评估质量,并在需要时重试。发布就绪门禁(Publish-Ready Gate):上线前的最后一道安全网,检查是否存在政策违规、物理瑕疵以及品牌一致性。2. 智能体如何协作 成对比较:QA 智能体将原始照片和编辑后的照片并排放置,检查是否存在幻觉(例如,多出两只鸡翅或去掉蘸酱)。自我纠正:如果 QA 拒绝某项编辑,它会向编辑智能体反馈明确的指令(如“修复份量”),并将重试次数限制在 K 次(Pass@K 指标)。3. 为什么集中式日志记录不可或缺 所有智能体都输出到单一、扁平的 JSON 日志轨迹中。任何人——工程师、产品经理或设计师——都可以检查确切的失败点。要点:如果不先记录每一个微观决策,就无法优化或自动调优智能体流水线。4. 神奇之处:自动自调优循环 当模型漂移或在边缘情况下失败时,无需任何人编写新代码。一个自主的诊断智能体(Diagnoser Agent)会接管:发现故障:检查生产日志和人工反馈,定位是哪个智能体出了问题。反思与综合:子智能体分析失败模式,并自动重写提示配置。基准测试:新提示会针对一个不可变的人工标注照片“黄金数据集”进行测试。如果通过,它就会直接自动部署到生产环境。
查看原文

相似文章

Uber 通过 AI 提供卓越的按需服务体验

OpenAI Blog

Uber 讨论了其跨多个业务部门(出行、Uber Eats、杂货)的 AI 战略,通过个性化、智能自动化和富有同情心的客户支持来增强用户体验,将 AI 视为劳动力增强的智能助手。

uber/ADR

GitHub Trending (daily)

Uber 发布了 ADR(Agentic AI 检测与响应),这是一个面向 AI 代理的开源企业安全系统,包括遥测传感器、基准测试和双代理检测器。随附论文已被 MLSys 2026 接收。