@drfeifei:1/N 长周期、复杂且真正关乎日常生活的任务,并非当今机器人技术所能解决的问题,需要规…

X AI KOLs Timeline 事件

摘要

李飞飞博士宣布斯坦福大学 BEHAVIOR 挑战赛进入第二年,这是一项针对长周期、复杂日常任务的机器人竞赛,新增了任务、改进了评估方式,并设有 11,000 美元的奖金池。

1/N 长周期、复杂且真正关乎日常生活的任务,并非当今机器人技术所能解决的问题,这需要规划、物体检测、物体操作以及故障恢复。 这就是斯坦福大学的 BEHAVIOR 挑战赛再次回归第二年度的原因!去年,获胜方案的任务完全成功率仅为 12.4%。今年,BEHAVIOR 挑战赛拥有更多任务、更好的评估方式,且更易于使用。 提交截止日期:2026 年 10 月 16 日 优胜者公布:2026 年 11 月 4 日 奖金池:11,000 美元
查看原文
查看缓存全文

缓存时间: 2026/07/13 22:01

1/N 长期、复杂且日常生活中真正重要的任务,仍是当今机器人技术尚未解决的难题——它们需要规划、目标检测、物体操作以及故障恢复能力。

正因如此,斯坦福的 BEHAVIOR 挑战赛再次回归,迎来第二年!去年,获胜方案仅实现了 12.4% 的完整任务成功率。今年,BEHAVIOR 挑战赛增加了更多任务、改进了评估方式,并且使用更加便捷。

提交截止日期:2026 年 10 月 16 日
获奖者公布:2026 年 11 月 4 日
奖金池:11,000 美元

2/N 真实世界中的机器人评估至关重要,但难以规模化:实验难以控制、复现和比较。模拟环境则是实现可扩展、可控、可复现评估的强大测试平台。

BEHAVIOR-1K 是一个开源仿真基准测试,包含 1,000 项日常家庭活动,要求长期推理、导航和双臂操作能力,为我们提供了一种可扩展的方式来衡量机器人 AI 模型的泛化能力。

2026 年 BEHAVIOR 挑战赛的新内容是什么?

  1. 任务数量翻倍,难度加倍

我们将基准测试从 50 项翻倍至 100 项长期家庭任务。这些活动平均耗时 6 分钟,需要导航、规划、记忆和双臂协调能力。在难度上,没有其他机器人基准测试能与之媲美。

  1. 更大规模的数据集,更好的基线模型

• 20,000 个人类遥操作演示,总计 1,950 小时(是 2025 年的两倍)
• RGBD 观测数据与机器人本体感知信息
• 技能/子任务标注
• 强大的基线支持:pi0.5、GR00T N1.7

5/N 评估与提交

为了更贴近实际部署场景,今年 BEHAVIOR 挑战赛仅设置一个官方赛道,使用机器人机载观测数据:

• RGB
• 深度
• 本体感知

提交说明和评估详情请见:https://behavior.stanford.edu/challenge/

6/N 让我们共同探讨:

当前模型能否解决完整的、以人为中心的家务任务?
智能体应如何结合控制、记忆与规划?
当今模型在哪些方面泛化失败?
在具身智能中,什么才能真正实现规模化?

7/N 加入 BEHAVIOR Discord 服务器,提出问题和参与讨论:

https://discord.gg/bccR5vGFEx

我们还将在每周一太平洋时间下午 5–6 点通过 Zoom 举行答疑时间。链接请参见网站。

无论您是机器人领域的老手,还是刚刚入门,我们都会提供支持。

8/N 我们为以下学生和合作者的杰出工作感到自豪,他们由 @drfeifei 领导:

@wensi_ai
@stefyfren
@cgokmenAI
@yalcintur36
@minyeongkim_
@BrndaHere2Chl
@AndiXu1111

@RavenHuang4
@RuohanZhang76
@jiajunwu_cs

9/N 同时,感谢以下人士的强力支持:
@EvansXuHan
@jin_lynn808
@Hang_Yin_
@ChengshuEricLi
@josiah_is_wong
@sanjana__z
@YunfanJiang
@wenlong_huang

@RobobertoMM
@YunzhuLiYZ
@ManlingLi_
@Weiyu_Liu_
@silviocinguetta
@hyogweon
Prof. Karen Liu

10/N 我们感谢 @SimovationInc 为 BEHAVIOR 数据集提供的高质量 JoyLo 模拟遥操作数据。

BEHAVIOR 基于 @nvidia Omniverse 构建。感谢 @nvidia 的持续支持。

11/N 我们感谢赞助商和支持者的慷慨支持。

@SimovationInc
@IMDAsg
@StanfordHAI
@SchmidtFutures
Calder Inc.

相似文章

@jietang:近期思考:向长程任务的转变。今年最有可能的突破将出现在长程任务领域。…

X AI KOLs Timeline

文章探讨了长程人工智能任务和自主代理系统(Autonomous Agents)即将取得的突破,指出企业模式正从“一人公司”向“无人公司”转变。文章强调,记忆、持续学习和自我评判等技术支柱是实现完全自我进化的人工智能系统的关键,这可能重新定义通用人工智能(AGI)和操作系统。