不漂移的AI科学家:四足导航研究循环中的品味、结构与可证伪发现

arXiv cs.AI 论文

摘要

这篇arXiv论文提出了一个AI科学家循环,用于研究四足机器人导航中的泛化,添加了实验卡片、专门化子代理以及一个名为kkanbu的偏好预言机,以防止漂移并保持自主研究的可证伪性。

arXiv:2608.07542v1 公告类型:新 摘要:由大型语言模型驱动的自主研究循环可以大规模运行机器学习实验,但往往倾向于漂移到它们所优化的任何指标的局部改进,而不是测试激发实验的假设。我们从结构上解决这个问题,并提出了一个AI科学家,用于研究模拟中四足机器人导航策略的泛化。基于Karpathy的autoresearch范式,我们的循环增加了三个组件:一个不可变的实验卡片,将每次迭代的预测与固定模式下的结果配对,从而使被证伪的假设无法被追溯修改;限制于机械角色的专门化子代理;以及kkanbu,一个偏好预言机,将用户的研究品味保存为类型化知识图谱,并且是唯一允许做出主观判断的组件。为了隔离预言机,我们在十一个研究流中运行相同的循环两次,分别有和没有kkanbu。两个分支都不会漂移:两者都证伪了大约四分之三的自身假设,而最佳训练策略来自没有预言机的分支。预言机改变的是方向,而不是分数:它独自探索了测试时适应,它在自己领先的分支中撰写了获胜设计,并且它跨研究流传递了另一个分支反复重新推导的教训。脚手架保持循环的诚实;kkanbu决定它看向哪里。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:02

# 一个不会漂移的 AI 科学家:四足导航研究循环中的品味、结构与可证伪发现
来源:https://arxiv.org/html/2608.07542

###### 摘要

大型语言模型驱动的自主研究循环可以大规模运行机器学习实验,但往往会朝着优化指标的局部改进方向漂移,而不是去检验驱动这些实验的假设。我们针对这一问题进行了结构性处理,并提出了一个 AI 科学家系统,用于在仿真中研究四足机器人导航策略的泛化能力。基于 Karpathy 的 autoresearch 范式,我们的循环增加了三个组成部分:一张不可变的*实验卡片*,在固定模式下将每次迭代的预测与其结果配对,因此被证伪的假设无法被事后改写;专业的子代理,被限制在机械性角色中;以及 kkanbu,一个偏好预言机,将用户的研究品味保存为类型化知识图谱,并且是唯一被允许做出主观判断的组件。为了隔离预言机的影响,我们在十一条研究流上完全相同地运行了两次循环,一次带 kkanbu,一次不带。两个分支都没有漂移:两者都证伪了大约四分之三的自身假设,而最佳训练策略来自无预言机分支。预言机改变的不是分数,而是方向:它独自探索了测试时自适应,在它主导的分支中撰写了获胜设计,并将经验跨流传递,而另一个分支则反复重新推导这些经验。脚手架保证了循环的诚实性;kkanbu 决定它看向何处。  
机器学习,ICML

## 1 引言

学习式导航策略作为经典路径规划流程的替代或补充,正受到越来越多的研究。与手工设计的规划器相比,神经策略可以产生更具响应性的行为,并适应边缘情况。四足导航更加困难:策略必须协调避障与可行的运动。泛化问题也尚未解决。在一个分布上训练的策略在条件变化时通常会退化,而哪些训练时的选择能缩小这一差距尚不清楚。我们研究 Unitree Go1 四足机器人的层次化设置,其中冻结的运动策略执行由学习式导航策略从 LiDAR 和目标观测中预测出的运动指令 $(v_x,v_y,v_{yaw})$。策略在程序化生成的障碍环境中训练,并在不断增加的障碍密度下进行评估,以衡量分布外(OOD)泛化能力。

每种候选范式都有已知的权衡。模仿学习稳定且数据高效,但继承了专家的盲点(Pomerleau,1989 (https://arxiv.org/html/2608.07542#bib.bib42); Codevilla et al.,2018 (https://arxiv.org/html/2608.07542#bib.bib55); Bojarski and others,2016 (https://arxiv.org/html/2608.07542#bib.bib43))。在线强化学习可以超越示范,发现自适应的避障行为,但稀疏的导航奖励和碰撞惩罚使优化变得困难(Mnih and others,2015 (https://arxiv.org/html/2608.07542#bib.bib56); Lillicrap and others,2015 (https://arxiv.org/html/2608.07542#bib.bib57); Schulman et al.,2017 (https://arxiv.org/html/2608.07542#bib.bib5))。离线强化学习是中间地带,其性能取决于数据集覆盖范围和动作空间支持(Fujimoto and Gu,2021 (https://arxiv.org/html/2608.07542#bib.bib58); Kostrikov et al.,2021 (https://arxiv.org/html/2608.07542#bib.bib59))。在密度变化下这些方法中哪一种泛化最好,仍是开放问题。设计空间随后包含许多相互作用的选项:运动指令与路点预测、观测多少动作历史、如何针对特定失败模式设计奖励,以及是单独评估范式还是作为混合体评估。

这种结构适合自主研究循环。一个有用的 AI 科学家不应仅仅大规模运行实验;它还应让未解决的假设、负面结果和提出的失败机制跨批次保持活跃,以便后续实验检验开放问题,而不是打磨当前的最优方案。因此,我们构建了一个用于四足导航的 AI 科学家系统。早期一种 autoresearch 风格的循环接受 markdown 问题陈述,并自动提出、实现和评估实验(Karpathy,2026 (https://arxiv.org/html/2608.07542#bib.bib40))。在实践中,它的选择会漂移到当前最佳配置的改进方向。新系统增加了 kkanbu,一个将研究者品味保存为可查询知识图谱的预言机,并配以一个结构化的多代理工作流,用于规划、实现、调试、评估和分析。结构化的实验记录捕获实验前的预测、结果和事后解释,因此发现和被证伪的假设能够跨批次持续存在,而不是消失在按时间顺序排列的日志中。

我们在一个共享的障碍导航基准上实例化该系统,涵盖特权模仿学习、带 Pure Pursuit 控制的路点模仿学习、离线强化学习和在线强化学习,并运行两次:一次在四个方向决策交接点使用 kkanbu,另一次完全没有品味工件。两个分支都表现得像研究者而不是排行榜攀爬者:它们证伪了自身大部分假设,在分数压力下遵守预先注册的证伪阈值,并收敛到机制层面的解释。最佳训练策略来自无预言机分支;只有预言机分支探索了测试时自适应,并在冻结权重上产生了最高的绝对结果。我们的贡献有三方面。¹

¹代码、两个消融分支的完整实验记录以及冻结的预言机配置快照可在 https://github.com/Jaeha0526/autoresearch_with_kkanbu 获取。

首先,我们引入了一种 AI 科学家架构,将结构诚实性(不可变的实验卡片、内容中立的子代理)与研究方向(可查询的品味预言机)分离开来。其次,我们报告了在十一条研究流上对预言机进行的受控双臂消融:仅靠结构就能消除漂移病理,而预言机的可测量贡献在于用户搜索轴上的广度、对特定获胜设计的撰写,以及跨流记忆,且没有分数代价。第三,我们从运行中提出了机制层面的发现,包括两个分支共同暴露的表示边界,以及预言机分支发明的可部署测试时过滤器。

## 2 相关工作

### 2.1 机器人的学习式导航

学习式导航策略长期以来一直作为移动机器人经典规划的替代或补充(Pomerleau,1989 (https://arxiv.org/html/2608.07542#bib.bib42); Bojarski and others,2016 (https://arxiv.org/html/2608.07542#bib.bib43); Sadeghi and Levine,2016 (https://arxiv.org/html/2608.07542#bib.bib44)),涵盖轮式机器人、无人机和四足机器人上的强化学习、模仿学习及混合方法(Kahn and others,2018 (https://arxiv.org/html/2608.07542#bib.bib45); Tai et al.,2017 (https://arxiv.org/html/2608.07542#bib.bib46); Chiang and others,2019 (https://arxiv.org/html/2608.07542#bib.bib47))。层次化控制是腿足系统的标准做法:低层运动控制器执行来自高层导航策略的指令(Hwangbo and others,2019 (https://arxiv.org/html/2608.07542#bib.bib48); Lee and others,2020 (https://arxiv.org/html/2608.07542#bib.bib49); Liang and others,2024 (https://arxiv.org/html/2608.07542#bib.bib50))。特权模仿学习提供来自专家规划器的稳定监督;强化学习可以超越示范,发现自适应行为(Ross et al.,2011 (https://arxiv.org/html/2608.07542#bib.bib51); Codevilla et al.,2018 (https://arxiv.org/html/2608.07542#bib.bib55))。相对于轮式机器人和无人机,四足导航中障碍密度泛化的系统性研究仍然有限。我们通过一种自主 AI 科学家工作流来解决这一问题,该工作流在实验批次之间提出、评估并重新审视导航假设。

### 2.2 自主研究代理与 AI 科学家

最近的 AI 科学家系统使用大型语言模型来提出实验、修改代码、启动训练任务、分析结果并撰写报告。*autoresearch*(Karpathy,2026 (https://arxiv.org/html/2608.07542#bib.bib40))在紧密循环中运行代理:给定程序描述和评估指标,代理提出代码更改,短暂训练,并且仅当指标提高时才保留更改。*The AI Scientist*(Lu and others,2024 (https://arxiv.org/html/2608.07542#bib.bib52))生成并评估研究想法;*Co-Scientist*(Google Research,2025 (https://arxiv.org/html/2608.07542#bib.bib54))使用多代理工作流生成并批评假设;Voyager(Wang and others,2023 (https://arxiv.org/html/2608.07542#bib.bib53))通过工具使用追求长视野的自主学习。这些系统很好地处理了研究的执行端:提出变体、运行任务、编辑代码。更困难的问题是下一步该运行什么、该放弃哪些方向、哪些结果值得深入研究。此类研究方向的判断无法从被优化的指标中推导出来,而缺乏外部方向来源时,autoresearch 循环往往会收敛到当前最佳配置的局部改进。我们的工作针对这一缺口。提出的系统在结构化实验记录中跨批次保留未解决的假设、失败的解释和先前的发现,并通过 kkanbu(一个保存某位研究者品味的可查询预言机)来路由每个方向决策。我们通过在有和没有 kkanbu 的情况下运行循环来衡量预言机带来了什么。

## 3 方法

我们在一个森林导航基准上比较五个范式流:PIL 控制(第 3.3 节 (https://arxiv.org/html/2608.07542#S3.SS3))、PIL 轨迹(第 3.4 节 (https://arxiv.org/html/2608.07542#S3.SS4))、带 IQL 的离线强化学习(第 3.5 节 (https://arxiv.org/html/2608.07542#S3.SS5)),以及在线强化学习 PPO 的纯和特权批评家变体(第 3.6 节 (https://arxiv.org/html/2608.07542#S3.SS6))。

### 3.1 问题设置

所有实验都在仿真中进行;我们不主张 sim-to-real。我们的重点是在训练时决定分布外泛化能力的选择,而 autoresearch 循环在仿真中更易处理。一个 Unitree Go1 从随机初始化的出生点导航到 $30\,\mathrm{m}$ 方形房间中的 $(x,y)$ 目标。圆柱形障碍物从强度为 $\delta$(默认 $\delta=0.04\,\mathrm{m}^{-2}$)的泊松点过程采样,并在 MuJoCo(Todorov et al.,2012 (https://arxiv.org/html/2608.07542#bib.bib21))中通过 MJX 模拟(Freeman et al.,2021 (https://arxiv.org/html/2608.07542#bib.bib16); Zakka et al.,2025 (https://arxiv.org/html/2608.07542#bib.bib15))。75 维观测结合了 64 束 LiDAR、目标编码和速度指令历史;动作以 $50\,\mathrm{Hz}$ 输出速度指令。完整的环境、观测和动作规范见附录 D (https://arxiv.org/html/2608.07542#A4)。我们在 $\delta\in\{0.01,\allowbreak 0.02,\allowbreak 0.04,\allowbreak 0.08,\allowbreak 0.12,\allowbreak 0.16\}\,\mathrm{m}^{-2}$ 上评估,每个密度 100 个回合。为强调杂乱环境中的鲁棒性,我们报告加权复合指标 $S_{\mathrm{comp}}=(1.0\,S_{0.01}+1.0\,S_{0.02}+1.0\,S_{0.04}+1.5\,S_{0.08}+2.0\,S_{0.12}+2.5\,S_{0.16})/9.0$,其中 $S_\delta$ 是密度 $\delta$ 下的成功率。密度是分布偏移的主要轴。对障碍物形状、房间大小和障碍物大小的初步扫描产生了个位数的 OOD 下降;密度在最密集设置下产生了数十个点的下降,因此我们聚焦于密度。

### 3.2 层次化控制架构

一个冻结的运动策略(Schulman et al.,2017 (https://arxiv.org/html/2608.07542#bib.bib5); Lee et al.,2020 (https://arxiv.org/html/2608.07542#bib.bib25); Miki et al.,2022 (https://arxiv.org/html/2608.07542#bib.bib26)),预训练了 $10^8$ 步,将本体感觉和速度指令映射到 12 维关节目标,从而将*导航*作为研究变量隔离出来。可训练的导航层输出速度指令,在交给运动控制器之前按 $v^{\max}$ 缩放。

### 3.3 特权模仿学习(PIL)控制

PIL 控制训练学生策略模仿特权专家。专家看到地面真值环境信息;学生只能看到机载观测。

#### 专家。A\* 在 $0.2\,\mathrm{m}$ 占用网格上规划路径,由 Pure Pursuit(Coulter,1992 (https://arxiv.org/html/2608.07542#bib.bib20))跟踪器跟随。我们选择 A\*(Hart et al.,1968 (https://arxiv.org/html/2608.07542#bib.bib22))而不是 RRT/RRT\*/PRM\*,因为它在网格上是完备且最优的;基于采样的规划器仅渐近最优,并产生不确定性的教师轨迹(Karaman and Frazzoli,2011 (https://arxiv.org/html/2608.07542#bib.bib29))。Pure Pursuit 使用比例偏航控制($k_p=1$)、对齐调制的前进速度 $\max(\cos\theta_{\mathrm{err}},\mathrm{MAF})$,以及减速 $\min(d/d_{\mathrm{slow}},1)$,其中 $d_{\mathrm{slow}}=2\,\mathrm{m}$。主要旋钮是最小对齐因子 $\mathrm{MAF}$。$\mathrm{MAF}=0.3$ 产生平滑的始终前进示范;$\mathrm{MAF}=0.0$ 允许停止-旋转,产生双峰指令分布(MAF0)。

#### 学生。一个隐藏维度为 $(512,256,128)$ 且使用 Swish 激活(Ramachandran et al.,2017 (https://arxiv.org/html/2608.07542#bib.bib24))的 3 层 MLP,通过 tanh 重新缩放输出,将 75 维观测映射到动作 $a^{*}=(v_x,v_y,v_{\mathrm{yaw}})$。训练使用约 $\sim\!10^7$ 个专家转换,采用速度上的 MSE(公式 1 (https://arxiv.org/html/2608.07542#A2.E1));Adam 配合余弦退火学习率 $10^{-3}$、1k 预热步和基于耐心的早停。其余超参数见附录 B (https://arxiv.org/html/2608.07542#A2)。

### 3.4 PIL 轨迹

#### 为什么用路点而不是速度?在杂乱环境中,相似的观测允许多种有效的避障动作(同一障碍物周围向左 vs. 向右)。因此,直接对速度进行行为克隆(BC)会产生模糊的监督;在 MSE 下,模型会平均各个模态,并在障碍物附近振荡。路点预测监督一条连贯的未来路径:几何上不一致的轨迹会产生较大的坐标空间误差,迫使网络承诺于单一策略。最近的导航系统也使用同样的技巧。学生策略将 $o\in\mathbb{R}^{75}$ 映射到 $\tau=s\,\tanh(f_\theta^{\mathrm{raw}}(o))\in\mathbb{R}^{2H}$,其中 $H=10$,$\Delta t=0.5$ s,$s=5$ m,使用预测路点序列上的 MSE 训练(公式 2 (https://arxiv.org/html/2608.07542#A2.E2))。

#### LiDAR-注意力头。扁平 MLP 会丢弃 LiDAR 的方位结构。我们将每束光束视为一个令牌,添加位置编码 $p_i=i/64$,在 64 个令牌上运行 4 头自注意力(Vaswani et al.,2017 (https://arxiv.org/html/2608.07542#bib.bib19)),并通过一个学习的每令牌门控 $\alpha_i\in[0,1]$ 进行池化,得到 $z_{\mathrm{lidar}}=\sum_i \alpha_i \tilde{h}_i$。融合后的 $[z_{\mathrm{goal}}\,\|\,z$

相似文章