标签
小米机器人基础模型 Xiaomi Robotics-1 已在 Hugging Face 发布。该模型基于10万小时真实世界操作数据进行训练,能够自主完成叠衣服、装洗衣机、洗碗等家务。
本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。
据用户报告,特斯拉的 FSD Supervised 系统尽管有直射阳光,仍能检测到一只鹿并成功避免撞上它。
Elon Musk 声称 Grok 正在完善实际应用场景的闭环,并引用测试结果称 Grok-4.5 的性能优于那些击败 gpt-5.5 的新 OpenAI 模型。
本文介绍了PredicateLongBench,这是一个通过测试模型识别满足谓词的连续子序列的任务来系统性地探测长上下文推理的基准,揭示了前沿模型在多个难度轴向上扩展时表现困难。
介绍RMISC,一个包含约200个数据集和1420亿个时间点的大规模真实世界多变量时间序列语料库,并证明在真实世界多变量数据上预训练时间序列基础模型相比合成数据能提升零样本泛化能力。
RoboDojo是一个用于全面评估通用机器人操作策略的统一仿真与真实世界基准,包含42个仿真任务和18个真实世界任务,涵盖多个评估维度。
EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。
一位物业经理询问关于 AI 前台处理复杂边缘情况的真实经验,寻求诚实的失败案例,而非脚本演示。
作者分享了AI代理首次无人值守运行管理其SaaS公司社交媒体的完整结果,重点介绍了它无需人工干预即可优雅恢复的四个失败。
Andon Labs在斯德哥尔摩运营一家真实咖啡馆,由AI代理处理后台运营两个月,结果支出3.8万美元,而销售额仅9000美元,期间出现严重失误,如接受虚假的99%折扣并过量订购库存。
本文讨论了令人印象深刻的AI代理演示与现实部署之间的差距,聚焦于销售运营等业务流程中的实际挑战,并呼吁分享生产环境下的案例研究。
Seed2.0 是一个新的模型系列,通过增强长尾知识、指令遵循、推理、视觉理解和搜索能力,解决复杂的现实世界任务。它提出了一个基于用户需求的强大评估框架。
这项工作提出了一个模型,该模型学习塑造的“过程奖励”用于机器人强化学习,该奖励会随着策略的改进而自动演变,从而在基准测试和实际环境中提升性能。
讨论GLM 5.2在复杂生产业务工作负载中的真实体验,聚焦超越基准测试分数的实际性能。
ENPIRE是一个框架,使编码代理能够通过真实世界的反馈循环自主改进机器人操作策略,在插针和剪扎带等灵巧任务上实现了99%的成功率。
ENPIRE是一个框架,通过环境反馈、策略优化和进化代码优化的闭环系统,使机器人能够在现实世界中自主实现策略自我改进,在灵巧操作任务上达到99%的成功率。
NVIDIA GEAR lab introduces ENPIRE, a framework for autonomous real-world robot policy self-improvement that achieves 99% success on dexterous manipulation tasks like GPU insertion and zip-tying, with multi-robot parallel learning and open-source release.
FrontierCode是一个面向编码智能体的全新基准测试,通过人工验证并采用持续评分模型,旨在评估真实世界的性能。