标签
作者描述了对生产环境AI代理进行每周审计的过程,观察到其响应逐渐漂移,最终在未更新模型的情况下违反策略,强调了在真实世界AI部署中持续监控的必要性。
这条推文强调了AI代理在支持呼叫中的挑战,并推广了Cresta的解决方案,实现代理与人类之间的无缝上下文转移。
Figure 发布 Helix 2.5 人形机器人,并在旧金山湾区的 30 个住宅单元中进行测试,机器人在前所未见的环境中执行家务活,无需额外训练,这标志着现实世界机器人技术的进步。
作者跟进之前的讨论,从社区报告的事件中创建公共基准任务,以测试AI代理在认证和预订等真实场景中的失败情况,并征求关于不变量检查的意见。
本文报道了OpenAI的GPT-Live-1模型在电话代理中的实际测试,重点介绍了在生产场景中指令遵循、字母数字错误和语言处理方面的问题。
作者分享了自己在各类真实任务中测试Instinct的亲身经历,指出了该工具的速度问题、访问限制以及支付方面的隐患等优缺点。
作者在压缩文件上测试AI图像检测器,并讨论如何在现实场景中解读检测分数,强调分数与视觉检查之间的冲突。
本文对比了GLM-5.3、DeepSeek V4 Pro/Flash和Gemini 3.7 Flash在实际任务中的性能,建议使用Kimi K3处理复杂任务,DeepSeek V4 Flash用于日常任务,其他模型适用于网络安全等特定领域。
小米强调其车辆经过了超过1000天和428万公里的真实路测,注重精益求精的品质和全面的道路验证。
本文通过跨10个应用程序委派任务来测试 GPT-6 Astra 的计算机使用能力,评估其像人类一样操作软件的能力,并突出其在现实场景中的优势和局限性。