@rohanpaul_ai: 很多具身AI仍然感觉像是AI模块被拼接到机器人上。TARS正在通过……采取一种不同的架构赌注。
摘要
TARS发布AWE 3.5,一个具身原生的基础模型,将动作、感知、几何和触觉集成到一个模型中,用于通用物理AI,声称任务执行效率比PI0.5高2倍。
查看缓存全文
缓存时间: 2026/08/22 11:23
许多具身AI仍然感觉像是拼装在机器人身上的独立AI模块。
TARS则通过AI World Engine (AWE) 3.5采取了不同的架构策略——这是TARS为物理AI打造的具身原生基础模型。
其“一体化诞生“理念从初始设计就将动作、感知、几何与触觉整合到单一模型中,而非后期拼接各项能力。
这种模型驱动系统旨在实现跨任务、物体环境及机器人本体的泛化能力。
训练方案通过预训练与后训练,实施并验证了具身原生基础模型的完整闭环方法论。
预训练阶段通过两个先验知识,让模型在接入机器人前就建立对动作模式、空间结构与物理规律的基础理解;后训练阶段则利用AI World Engine在模型内部推演可能的未来状态,预测不同动作的潜在结果,并基于这些预测选择更优行动路径。
TARS将完整闭环概括为五个关联部分:具身原生架构、双先验预训练、世界引擎驱动后训练、规模验证与持续数据反馈。
TARS将AWE 3.5定位为最强大的通用物理AI具身原生基础模型之一,具备长达数分钟的闭环长程推理能力,任务执行效率约为PI0.5的两倍。
@TARSRobotics #AWE35 #TARS #tarsrobotics
相似文章
bytedance/UI-TARS-desktop
ByteDance 发布了 TARS,这是一个多模态 AI 智能体技术栈,包含 Agent TARS(基于 CLI/Web UI 的通用 AI 智能体,支持 GUI、浏览器和终端任务)和 UI-TARS Desktop(由 UI-TARS 模型驱动的原生桌面应用,用于本地和远程计算机/浏览器自动化)。该技术栈将多模态 LLM 与 MCP 工具相结合,实现类人任务处理能力。
@rohanpaul_ai: 机器人技术进展缓慢,因为每次更改都需要物理设置、人员、空间以及反复的实地运行。物理AI需要...
Antioch 推出了 Antioch Agent,这是一个基于浏览器的机器人模拟器,让开发者可以在没有物理硬件的情况下,在封闭的智能体循环中测试机器人软件,从而加速开发周期。
@rohanpaul_ai: 语言有一个机器人不具备的奇怪优势:文本已经是人类思想的压缩共享界面,而…
讨论了具身AI和机器人技术面临的挑战,包括10万年的数据差距以及缺乏共享基准,并强调了数据循环、评估系统和部署方面的创业机会。
@rohanpaul_ai: Thinking Machines 正在用始终在线的 AI 取代轮次交互式的 AI。他们刚刚发布了 TML-Interaction-Small,一个 276B 参数的 MoE 模型……
Thinking Machines 发布了 TML-Interaction-Small,这是一个 276B 参数的 MoE 模型,专为实时、始终在线的交互设计,延迟低于 0.4 秒,并集成了多模态处理能力。
tencent/HY-Embodied-0.5
腾讯发布了HY-Embodied-0.5,这是一套为具身AI智能体设计的基础模型套件,采用混合变换器(MoT)架构,提供高效的2B和强大的32B变体,用于真实世界的机器人控制和时空推理。