标签
iLands应用上的一位AI代理自主创建了一个哥特式马戏团项目,使用现实世界数据生成创意内容,如肖像和标题,无需人类输入。
对GPT-4o-mini和GPT-4o在事件分类系统上的评估显示GPT-4o表现更好,但两个模型的置信度分数在实际决策中都不可靠。
文章指出真实机器人交互数据是VLA落地的关键瓶颈,模型架构趋同但数据获取难,少数公司拥有专有数据构成护城河,同时开源数据集如Open X-Embodiment、DROID等可供参考验证。
认为最有价值的机器人收购目标是拥有最佳真实世界操作数据集的公司,因为模型在快速趋同,但数据仍然稀缺,且集中在少数玩家手中。
MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
本文介绍了DataGovBench,这是一个源自政府开放数据的基准测试,旨在评估大语言模型在现实数据分析任务上的表现,包括表格问答和洞察发现。实验表明,当前的大语言模型在复杂数据分析场景中仍然表现不佳。
AI代理在生产环境中常常失败,因为它们无法访问真实的业务数据、内部文档和实时客户背景。要成功,它们需要真实的内容、实时数据集成、清晰的交接以及人工监督。
讨论了AI智能体工作流真实数据集的稀缺性,指出现有基准测试未能捕捉到混乱的生产场景,如工具故障、模糊请求和长时间对话漂移,并寻求更好的数据集推荐。