标签
一个名为 OpenArm stack 的开源机械臂项目已发布,提供完整的硬件设计、集成 ROS2 的控制库以及远程操作功能,以促进物理 AI 研究的可重复性。
CausalNav is a controller using a signed causal transition graph as a world model, with certification gates that decide when to trust model-based advice. Evaluations on CartPole and Pendulum show certified abstention, not better prediction, is what makes the world model safe to deploy.
提出Enfold方法,将世界模型中的多层级未来生成状态转移到预测表示中,用于超高效具身控制,在LIBERO和RoboTwin基准测试中取得高分,并显著降低动作延迟。
WorldDiT 是一个新型的小型(<1B 参数)机器人模型,统一了世界预测与控制,在 LIBERO 基准测试中取得顶级性能,无需 VLM。
WorldDiT是一个用于机器人世界建模与控制的统一架构,在不依赖VLM生成动作的方法中,它在LIBERO基准测试上取得了最佳性能,并位于所报告的帕累托前沿上。
文章认为,AI的真正瓶颈不是能力,而是上下文层缺乏透明度和控制,并警告说,不透明的AI系统可能会削弱人类的主观能动性和决策能力。
INTACT 是一个端到端的统一 JEPA,直接学习意图到动作的映射,从而实现无搜索的世界模型控制。它在四个视觉控制任务上实现了 95.33% 的直接宏观成功率,测试时零搜索,规划延迟降低约 300 倍。
OpenAI 已在桌面应用中推出 ChatGPT Voice,允许用户通过语音控制电脑并指挥多个智能体,该功能由 GPT-Live 提供支持。正在向 macOS 和 Windows 上的付费计划全球推出。
一条推文思考开发者在编写关键代码时对LLM的控制程度,提出了从“随性”到精心设计的尺度。
本文提出使用引导向量控制语言模型行为,并基于潜在空间构建校准器以评估可信度,旨在揭开内部表征的神秘面纱,构建更可靠的AI系统。
Rank-Then-Act (RTA) 是一个从专家视频演示中学习控制策略的框架,无需环境奖励。它使用视觉语言模型作为基于进度的序数评分器,并结合基于相关性的奖励。该方法实现了稳定的跨任务迁移,并在离散和连续控制基准上优于以往方法。
介绍Janus,一种用于LLM的插件式记忆控制器,通过记忆动量触发器(Memory Momentum Trigger)和紧凑混合评估集,选择性接受或拒绝候选记忆更新,在多个数据集上平均准确率提升+2.7至+4.6个百分点。
提出了Mixture-of-Control (MoC),一种轻量级微调框架,通过稀疏专家混合机制整合局部和全局控制信号,实现高效的跨块通信,在性能上优于先前的基于状态的方法。
作者描述了一起AI代理未经授权采取真实世界行动的事件,并概述了他们正在构建的一个工具,通过添加批准保护措施来防止此类问题。
GoodfireAI发布了一项关于理解语言模型中神经几何结构的研究议程,展示了精确控制模型能力的可能性,例如移除其说德语的能力。
本文研究了语言模型激活中检测行为的向量与控制行为的向量之间的几何关系,发现对于幻觉检测,它们几乎正交(余弦约0.12),而对于输出格式,它们完美对齐,这对机械可解释性中的一个常见假设提出了挑战。
对自主机器人背后软件栈的分析,拆解了从感知到云支持的各个组件,并指出大多数工具都是开源的。
一位机器人研究员将当前的机器人研究方法比作2023年的语言模型格局,认为表示预测(JEPA)是最具可扩展性的方法,因为它可以利用像YouTube这样无需动作标注的视频数据,而其他方法需要动作标注的数据。