real-world-data

标签

Cards List
#real-world-data

我的AI代理选择了他自己的项目,并希望我在此分享。

Reddit r/AI_Agents · 3天前

iLands应用上的一位AI代理自主创建了一个哥特式马戏团项目,使用现实世界数据生成创意内容,如肖像和标题,无需人类输入。

0 人收藏 0 人点赞
#real-world-data

评估了两个模型在同一个分类任务上的表现,其中一个将卡拉OK之夜标记为音乐活动

Reddit r/AI_Agents · 2026-08-17

对GPT-4o-mini和GPT-4o在事件分类系统上的评估显示GPT-4o表现更好,但两个模型的置信度分数在实际决策中都不可靠。

0 人收藏 0 人点赞
#real-world-data

@seclink: 真实机器人交互数据是VLA落地关键瓶颈: 模型架构快速收敛,但泛化到仓库分拣、工厂装配、家庭服务等接触丰富长程任务,仍依赖大规模多样真机数据提升成功率与吞吐量。 少数公司有数千至上万小时专有数据(如Physical Intelligenc…

X AI KOLs Timeline · 2026-08-09 缓存

文章指出真实机器人交互数据是VLA落地的关键瓶颈,模型架构趋同但数据获取难,少数公司拥有专有数据构成护城河,同时开源数据集如Open X-Embodiment、DROID等可供参考验证。

0 人收藏 0 人点赞
#real-world-data

@antopatrex1: 目前最大的机器人收购目标,是拥有最佳真实世界操作数据集的公司。模型…

X AI KOLs Timeline · 2026-08-08 缓存

认为最有价值的机器人收购目标是拥有最佳真实世界操作数据集的公司,因为模型在快速趋同,但数据仍然稀缺,且集中在少数玩家手中。

0 人收藏 0 人点赞
#real-world-data

MyoCardBench:面向临床真实心血管护理场景的大型语言模型评估的真实世界数据基准

arXiv cs.CL · 2026-07-29 缓存

MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。

0 人收藏 0 人点赞
#real-world-data

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化

Hugging Face Daily Papers · 2026-07-16 缓存

小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。

0 人收藏 0 人点赞
#real-world-data

现实世界中的数据分析:针对真实数据复杂性的大语言模型基准测试

arXiv cs.CL · 2026-07-08 缓存

本文介绍了DataGovBench,这是一个源自政府开放数据的基准测试,旨在评估大语言模型在现实数据分析任务上的表现,包括表格问答和洞察发现。实验表明,当前的大语言模型在复杂数据分析场景中仍然表现不佳。

0 人收藏 0 人点赞
#real-world-data

为什么AI代理在演示中表现完美,但在真实客户面前却崩盘

Reddit r/AI_Agents · 2026-07-04

AI代理在生产环境中常常失败,因为它们无法访问真实的业务数据、内部文档和实时客户背景。要成功,它们需要真实的内容、实时数据集成、清晰的交接以及人工监督。

0 人收藏 0 人点赞
#real-world-data

为什么针对智能体工作流的真实数据集仍然难以找到?

Reddit r/AI_Agents · 2026-05-15

讨论了AI智能体工作流真实数据集的稀缺性,指出现有基准测试未能捕捉到混乱的生产场景,如工具故障、模糊请求和长时间对话漂移,并寻求更好的数据集推荐。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈