机器人使用代理
摘要
本文探讨了将LLM用作机器人控制代理的新兴趋势,类似于计算机使用代理,并研究了通过云人工智能在机器人生态系统中快速扩散智能的潜力。
<p><a href="https://lobste.rs/s/ueh7gz/robot_use_agents">评论</a></p>
查看缓存全文
缓存时间: 2026/09/27 07:34
# 机器人使用代理
来源:https://web.mit.edu/phillipi/www/writing/robot-use-agents.html
今年我们将看到许多大型语言模型(LLMs)¹(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn1)被测试作为机器人使用代理。
正如LLM可以使用计算器、网络搜索甚至完整的计算机(“计算机使用代理”)等工具一样,LLM也可以将机器人用作工具。可以将其理解为Claude扮演机器人身体的操纵者。
这项能力已研究多年²(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn2)³(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn3)⁴(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn4),但长期以来存在一种普遍观点:虽然LLM可能有助于高层规划,但尚未适合完全控制。研究者认为LLM的延迟过高,无法跟上现实世界的动态变化⁵(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn5),模型的空间智能较差⁶(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn6),并且LLM缺乏足够强大的因果和物理理解能力⁷(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn7)。
随着Fable和Astra等新模型的出现,这些局限性正在逐渐消失。争论仍在继续,但现在是时候认真看待这些AI可能很快就能胜任通用机器人控制任务的可能性。确实,最近的演示提供了诱人的证据,表明某些变化正在开始⁸(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn8)⁹(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn9)¹⁰(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn10)。
值得思考这种变化带来的影响。如果LLM能够熟练地控制机器人,那么机器人能力的发展速度可能比预期的更快。每一台联网的机器人都可能成为Fable、Astra及其他AI的潜在工具。
这与机器人技术发展的其他愿景形成对比。目前,机器人智能主要在设备上运行,模型针对每种不同类型的机器人进行定制。这使得机器人智能化部署成为一个缓慢且渐进的过程。重要的是,这个过程是刻意的:赋予机器人AI能力是一个需要大量投入的工程选择。此外,机器人"大脑"的技术栈尚未成熟;研究者在世界模型、行为基础模型、持续学习方法等方面进行着不同的尝试。这些方法尚未像LLM那样成熟。
Claude作为"操纵者"可能导向一个相当不同的未来。这种智能运行在云端,并非专门为某一种机器人调校,且具备成熟的基础设施来支持。在这种范式下,机器人本身不一定需要改变。即使没有软件修改、没有新传感器或执行器、没有新的板载GPU¹¹(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn11),它们也能被赋予能力。汽车可能像工厂机械臂一样容易被控制。机器人智能的更新将通过空中进行,甚至完全在云端完成。今天还不具备智能的设备,明天可能仅通过软件更新就能启用AI¹²(https://web.mit.edu/phillipi/www/writing/robot-use-agents.html#fn12)。在这个未来,新事物不在于某个机器人变得更强——实际上,LLM控制的机器人性能仍远不及专用解决方案——而在于智能能够以比传统模式快得多的速度扩散到整个机器人生态系统中。
与此同时,仍存在一些局限性。LLM代理由于思考速度缓慢以及有限的网络速度,在指令之间存在高延迟。"操纵"可能不如经过验证的机器人系统可靠;这在高风险和安全关键场景中尤为重要。我认为这些局限性是可以克服的,但它们目前确实存在。
当下,世界正意识到任何数字工具都可以被智能AI使用。同样的情况可能很快将适用于任何物理机器人,甚至任何联网设备。这显然具有潜力,同时也伴随着风险。
---
感谢Nathan Cloos、Adam Rashid和Antonio Norelli提供的有益讨论,促成了本文的撰写。
相似文章
Isola:云端大语言模型或将很快用于操控联网机器人
Phillip Isola指出,基于云端的大语言模型很快就能实现对接入式机器人的控制,其方式类似当前大语言模型对浏览器或计算器的操控,不过目前仍存在一些限制。
运行时自适应计算迁移与LLM代理的自部署
文章描述了一个个人实验,涉及LLM代理,这些代理可以根据任务需求在不同的硬件基底之间迁移,探讨了代理身份和计算迁移的概念。
AI代理是否真的变得更智能,还是我们只是更擅长将工具连接到LLMs?
本文质疑AI代理的能力是源于真正的智能,还是围绕LLMs的工具编排得到了改进,探讨了什么定义了一个真正的AI代理。
有人能帮我理解AI Agent的用例或让我信服吗?
一位软件开发者质疑AI Agent的实际价值,表达了对控制权、问责制的担忧,并怀疑手动自动化结合LLM是否比委托给自主代理更可靠。
当今大多数'AI智能体'只是挂载了LLM的if-else工作流,并非真正的智能体
文章认为,大多数所谓的AI智能体实际上是附加上了LLM的简单工作流,缺乏真正的适应性,并提供了一种测试方法来区分真正的智能体与伪装的工作流。