标签
作者认为,当前的人工智能智能体基准测试忽略了诸如错误处理、人工干预和长期可靠性等实际问题,强调了操作因素对现实世界可信度的重要性。
X Square Robot 在直播中演示了其具身智能模型 WALL-B 和高性能六轴机器人手臂,在现实物流操作中自主分拣包裹,实现了每小时1,816个包裹的分拣速度,准确率超过98%。
一份来自726次Qwen3.6-35B Agent运行的第一手报告揭示:真实世界中的Agent故障与其说关乎推理,不如说更多地源于文书错误、过度自信的成功报告以及过度思考的代价——为Agent构建者提供了实用经验。
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
本文认为,text-to-SQL 基准测试必须考虑到真实世界数据存储的复杂性和挑战,而不仅仅是理想化的数据集。
小米机器人基础模型 Xiaomi Robotics-1 已在 Hugging Face 发布。该模型基于10万小时真实世界操作数据进行训练,能够自主完成叠衣服、装洗衣机、洗碗等家务。
本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。
据用户报告,特斯拉的 FSD Supervised 系统尽管有直射阳光,仍能检测到一只鹿并成功避免撞上它。
Elon Musk 声称 Grok 正在完善实际应用场景的闭环,并引用测试结果称 Grok-4.5 的性能优于那些击败 gpt-5.5 的新 OpenAI 模型。
本文介绍了PredicateLongBench,这是一个通过测试模型识别满足谓词的连续子序列的任务来系统性地探测长上下文推理的基准,揭示了前沿模型在多个难度轴向上扩展时表现困难。
介绍RMISC,一个包含约200个数据集和1420亿个时间点的大规模真实世界多变量时间序列语料库,并证明在真实世界多变量数据上预训练时间序列基础模型相比合成数据能提升零样本泛化能力。
RoboDojo是一个用于全面评估通用机器人操作策略的统一仿真与真实世界基准,包含42个仿真任务和18个真实世界任务,涵盖多个评估维度。
EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。
一位物业经理询问关于 AI 前台处理复杂边缘情况的真实经验,寻求诚实的失败案例,而非脚本演示。
作者分享了AI代理首次无人值守运行管理其SaaS公司社交媒体的完整结果,重点介绍了它无需人工干预即可优雅恢复的四个失败。
Andon Labs在斯德哥尔摩运营一家真实咖啡馆,由AI代理处理后台运营两个月,结果支出3.8万美元,而销售额仅9000美元,期间出现严重失误,如接受虚假的99%折扣并过量订购库存。
本文讨论了令人印象深刻的AI代理演示与现实部署之间的差距,聚焦于销售运营等业务流程中的实际挑战,并呼吁分享生产环境下的案例研究。
Seed2.0 是一个新的模型系列,通过增强长尾知识、指令遵循、推理、视觉理解和搜索能力,解决复杂的现实世界任务。它提出了一个基于用户需求的强大评估框架。
这项工作提出了一个模型,该模型学习塑造的“过程奖励”用于机器人强化学习,该奖励会随着策略的改进而自动演变,从而在基准测试和实际环境中提升性能。
讨论GLM 5.2在复杂生产业务工作负载中的真实体验,聚焦超越基准测试分数的实际性能。