通过玩“战舰”游戏教AI代理提出更好的问题

MIT News — Artificial Intelligence 论文

摘要

MIT CSAIL 和哈佛大学的研究人员借助一款改编版《战舰》游戏,研究并提升了语言模型的提问能力。通过运用蒙特卡洛推理策略,他们将 Llama 4 Scout 这样的小型模型对人类胜率从 8% 显著提升至 82%,不仅以更低成本超越了大型模型,还展现出更强的性能。

2026年,人工智能代理的 hype 比以往都更响亮。这些半自主程序能够“思考”并执行客户服务、软件开发等领域中定义明确的任务,通常使用语言模型。但在医疗诊断和科学发现等领域,它们需要在不确定环境中查询大量可能的解决方案,而这恰恰是语言模型所不擅长的。 麻省理工学院计算机科学与人工智能实验室与哈佛大学工程与应用科学学院的研究人员深入探究了语言模型,以理解其在高风险场景中的主要问题。他们的测试是“海战”游戏,这是一款经典猜谜游戏,曾帮助认知科学家研究人类如何寻求信息。 CSAIL 和 SEAS 的学者在此基础上增加了一个变体:将游戏重构为围绕自然语言问题的提问与回答。在他们的“协作海战”游戏中,一名参与者扮演“舰长”,负责询问隐藏船只的位置,而队友则扮演“观察员”,实时回答这些问题。 研究人员首先让40多名人类玩家一起玩游戏,收集他们的问题和是否回答,构建了“BattleshipQA”数据集。当团队在游戏上测试最先进的语言模型(如 GPT-5)和较小模型(如 Llama 4 Scout)时,这些结果成为了有用的对比基准。在未对模型进行预先训练的情况下,他们发现顶级语言模型可以在“海战”中“击败”人类——即用更少的回合完成游戏——但较小的系统则远没那么理性。 主要问题在于,许多模型并不擅长提出有用的问题。为了让语言模型以能揭示更多隐藏船只信息的方式提问,研究人员为每个模型提供了蒙特卡洛推理策略,该策略会仔细衡量每个回答下不同选项正确的可能性。结果:无论规模大小,AI 模型都能在“海战”中击败普通玩家。 或许最引人注目的结果是 Llama 4 Scout 的提升。作为一个相对较小的语言模型,它仅 8% 的情况下能击败人类。但通过改进其推理策略,该模型对抗人类的“海战”胜率达到了 82%。这种谨慎高效的问题提问方式也使该模型超越了前沿模型(GPT-5),同时运行成本仅为后者的约 1%。 除了这种改进,研究人员还缩小了人类与语言模型在回答问题方面的差距。虽然 GPT-5 是一个可靠的观察员,能帮助模型更快完成游戏,但较小的系统有一个坏习惯:在关于船只隐藏位置的问题上给出错误答案。当模型开始将问题转换为代码,明确告诉它们如何验证答案时(例如,当被问及某区域是否有船时,让模型快速搜索该区域),模型的准确率平均提升了 15%。 “当今的语言模型主要针对回答复杂查询进行了优化,但它们是否学会为自己提出好问题,这一点尚不明确,”麻省理工学院博士生、CSAIL 研究员、首席作者 Gabriel Grand SM '23 表示,他是一篇关于该工作的论文的主要作者。“我们的工作表明,提出信息量大的问题取决于预测和模拟世界的能力。我们发现,当我们让代理访问‘世界模型’时,它们会提出更好的问题,并更高效地进行发现。” **语言模型的巨变** 团队首先关注的是让语言模型提出更好的问题。通过实施蒙特卡洛推理策略,语言模型将潜在猜测视为单个粒子进行推理。那些随着观察员每次回答而显得更合理的粒子会被赋予更高权重,有点像每回合会充气或放气的游戏球。通过这种更具计算性、适应性的方法,“舰长”可以提出从“观察员”那里提取显著更多信息的问题。 随后,科学家们转向广泛使用的编程语言 Python 来帮助 AI 观察员。每个舰长提出的问题都会自动转换为编码指令。例如,像“第一列中是否有一艘跨两行的船?”这样的问题,会变成让观察员语言模型搜索相关区域并评估数字游戏棋子宽度的指令。通过用模型特别擅长的语言提供清晰指令,每个系统给出正确答案的频率显著提高。例如,轻量级系统 GPT-4o-mini 的性能提升了近 30%,即使是大型模型 Claude 4 Opus 也跃升了约 8 个百分点。 “该领域在‘自动形式化’策略上取得了许多成功,即语言模型生成代码来验证其解决方案,”资深作者、麻省理工学院电气工程与计算机科学副教授、CSAIL 首席研究员 Jacob Andreas 表示。“我觉得这项工作最令人兴奋的是,它开辟了通过先改善语言模型的探索和信息收集能力来生成更好解决方案的可能性。我们很高兴能将这项工作从科学领域扩展到编码和数学问题解决等应用。” **让我们玩点别的** 但这种方法在其他棋盘游戏中表现如何?团队在“猜猜我是谁?”游戏中测试了他们全新装备的语言模型,其中大小模型巧妙地筛选了 100 个选项,正确猜出了隐藏角色。Llama 4 Scout 的成功率为 30%,但在 Grand 及其同事的调整后,它在超过 72% 的尝试中完成了任务。而 GPT-4o 则从 62% 跃升至 90%。每局游戏中 GPT-5 均作为观察员,以确保问题尽可能准确地得到回答。 虽然语言模型在这两个游戏中都取得了有希望的进展,但仍有提升空间。例如,与人类相比,模型仍难以回答复杂问题。OpenAI 研究员、近期哈佛毕业生、合著者 Valerio Pepe 补充道:“GPT-5 可以击败普通‘海战’玩家,并且在使用我们的方法后表现略好。然而,对所有模型来说,专家级玩家仍然难以战胜,这与象棋不同,即使顶级棋手也无法战胜 AI 系统。” 研究人员的发现表明,AI 代理在“大海捞针”式发现方面具有未开发的潜力——在巨大的选项空间中导航,以找到科学挑战的罕见解决方案。虽然改进的信息寻求技能将使它们成为出色的研究助手,例如,在识别化合物的分子结构方面,但研究人员提醒说,“协作海战”是一个相对简单的测试平台。他们希望在更复杂的环境中测试语言模型,让系统必须考虑多得多的选项。 Grand 还计划让人类和 AI 模型协作,研究它们是否能更好地协同工作。模型也可能从对游戏模拟进行微调中受益,并且随着计算能力的提高,语言模型将拥有更先进的推理能力来预测游戏的演变。 “随着 AI 系统变得越来越具有自主性,最困难的问题竟然是社会性的:跟踪共同点、解决误解、并随着时间的推移适应不同的合作伙伴,”斯坦福大学语言学助理教授 Robert Hawkins 说,他并未参与该论文。“这项工作在一个受控的协作环境中优雅地捕捉了这些现象,并提出有力论据表明,AI 代理的真正瓶颈不仅仅是计算最优问题,”——但此处原文已被截断,依上下文补充为“而是社会互动”。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:36

# 通过玩“战舰”游戏,教会AI智能体提出更好的问题 来源:https://news.mit.edu/2026/teaching-ai-agents-ask-better-questions-playing-battleship-0603 2026年,人工智能智能体的热潮比以往任何时候都要高涨。这些半自主程序能够“思考”并执行客户服务和软件开发等领域的明确任务,通常使用语言模型。然而,在医学诊断和科学发现等领域,它们需要在不确定的环境中探究大量可能的解决方案,而这正是语言模型所不擅长的。 麻省理工学院计算机科学与人工智能实验室和哈佛大学工程与应用科学学院的研究人员深入研究了语言模型,以理解它们在高风险场景中的主要问题。他们的测试是:“战舰”游戏——一个经典的猜谜游戏,曾帮助认知科学家研究人类如何寻求信息。 CSAIL和SEAS的学者们通过将游戏重新定义为围绕自然语言问题的提问与回答,增加了一个新变化。在他们的“协作战舰”游戏中,一名参与者扮演“舰长”,询问隐藏船只的位置,而他们的队友则扮演“侦察兵”,实时回答这些问题。 研究人员首先让40多名人类一起玩这个游戏,收集他们的问题和是非答案,构建了“BattleshipQA”数据集。这些结果为团队在游戏中测试最先进的语言模型(如GPT-5)和较小的模型(如Llama 4 Scout)时提供了有用的比较基准。在没有预先训练模型的情况下,他们发现,顶尖的语言模型在“战舰”游戏中可以“击败”人类——即用更少的回合完成游戏——但较小的系统则远没有那么理性。 主要问题在于,许多模型根本不擅长提出有用的问题。为了让语言模型以能揭示更多关于隐藏船只信息的方式提问,研究人员为每个模型提供了一种蒙特卡洛推理策略,该策略根据每个回答仔细衡量不同选项正确的可能性。结果:无论规模大小,AI模型都能在“战舰”游戏中击败普通玩家。 也许最引人注目的结果是Llama 4 Scout的提升。作为一个相对较小的语言模型,它最初只有8%的概率击败人类。但通过对推理策略的改进,该模型在与人类对战时达到了82%的胜率。这种谨慎而高效的提问方式还使该模型能够超越前沿模型(GPT-5),同时其运行成本仅为后者的约1%。 除了这一改进,研究人员还缩小了人类与语言模型在回答问题方面的差距。虽然GPT-5是一个可靠的侦察兵,能帮助模型更快地完成游戏,但较小的系统有一个坏习惯:在关于船只隐藏位置的问题上给出错误答案。当这些模型开始将问题转化为明确指示如何验证答案的代码时(例如,当被问及某区域是否有船时,让模型快速搜索该区域),它们的准确率平均提升了15%。 “今天的语言模型主要针对回答复杂查询进行了优化,但尚不清楚它们是否学会了为自己提出好问题,”麻省理工学院博士生、CSAIL研究员Gabriel Grand SM '23说,他是一篇关于该工作的论文(https://openreview.net/forum?id=EQhUvWH78U)的主要作者。“我们的工作表明,提出有信息量的问题取决于预测和模拟世界的能力。我们发现,当赋予智能体对‘世界模型’的访问权时,它们会提出更好的问题,并更有效地做出发现。” **语言模型的巨变** 团队的首要任务是让语言模型提出更好的问题。通过实施蒙特卡洛推理策略,语言模型将潜在的猜测作为单独的粒子进行推理。那些根据侦察兵的每次回答而显得更有效的猜测会被赋予更大的权重,有点像每回合会膨胀或收缩的游戏球。有了这种更经过计算、自适应的方式,舰长能够提出从侦察兵那里提取更多信息的问题。 随后,科学家们转向广泛使用的编程语言Python来帮助AI侦察兵。舰长的每个问题都会被自动转换成编码后的指令。例如,像“第一列中是否有占据两行的船只?”这样的问题,会变成让侦察兵语言模型搜索该区域并评估数字游戏棋子有多宽的指令。通过用模型特别熟悉的语言给出清晰的指示,每个系统提供正确答案的频率显著提高。例如,轻量级系统GPT-4o-mini的性能提升了近30%,甚至大型模型Claude 4 Opus也提升了约8个百分点。 “该领域从‘自动形式化’策略中看到了许多成功,即语言模型生成代码来验证其解决方案,”资深作者、麻省理工学院电气工程与计算机科学副教授、CSAIL首席研究员Jacob Andreas说。“关于这项工作,我最兴奋的是,它开辟了首先使用这些技术生成更好解决方案的可能性,通过改进语言模型的探索和信息收集能力。我们很高兴能将这项工作从科学领域扩展到编码和数学问题解决等应用。” **玩点别的** 但这种策略在其他棋盘游戏中表现如何呢?团队在“猜猜我是谁?”游戏中测试了他们新装备的语言模型。在那里,大型和小型模型都巧妙地筛选出100个选项,正确猜出隐藏角色。Llama 4 Scout的成功率为30%,但在Grand及其同事的调整后,它在超过72%的运行中完成了任务。与此同时,GPT-4o从62%跃升至90%。GPT-5在每个游戏中担任侦察兵,以确保问题得到最准确的回答。 尽管语言模型在这两个游戏中取得了有希望的进展,但仍有改进空间。例如,与人类相比,这些模型仍然难以回答复杂问题。OpenAI研究员、近期哈佛毕业生、论文合著者Valerio Pepe补充说:“GPT-5能够击败普通的‘战舰’玩家,并且使用我们的方法后表现稍好。然而,对所有模型来说,专家级玩家仍然是难以击败的,这与国际象棋不同,在国际象棋中,即使是顶尖棋手也无法战胜AI系统。” 研究人员的发现表明,AI智能体在“大海捞针”的发现中具有尚未开发的潜力——在巨大的选项空间中导航,以找到科学挑战的稀有解决方案。虽然改进的信息寻求能力将使它们成为出色的研究助手,例如在识别化合物的分子结构方面,但研究人员警告说,“协作战舰”是一个相对简单的测试平台。他们希望在更复杂的环境中测试语言模型,其中系统需要考虑多得多的选项。 Grand还计划让人类和AI模型协作,以研究它们是否能更好地协同工作。模型也可能受益于在游戏模拟上进行一些微调,并且有了更多的计算能力,语言模型将拥有更先进的推理能力来预测游戏将如何演变。 “随着AI系统变得越来越智能体化,最困难的问题最终变成了社会性的问题:追踪共同基础、解决误解,以及随着时间推移适应不同的合作伙伴,”斯坦福大学语言学助理教授Robert Hawkins说,他没有参与该论文。“这项工作优雅地在受控的协作环境中捕捉了这些现象,并令人信服地指出,AI智能体真正的瓶颈不仅仅是计算最优问题,而是充分利用其答案所需的语用推理。” Grand和Pepe与两位CSAIL首席研究员共同撰写了论文:麻省理工学院副教授Jacob Andreas和麻省理工学院教授Joshua Tenenbaum。他们的工作部分得到了麻省理工学院Siegel家族Quest for Intelligence、麻省理工学院-IBM Watson AI实验室、FinTechAI@CSAIL倡议、斯隆研究奖学金、英特尔、空军科学研究办公室、国防高级研究计划局、海军研究办公室和国家科学基金会的资助。他们于4月在国际学习表征大会上以口头报告形式展示了他们的论文。

相似文章

重新思考我们如何衡量AI智能

Google DeepMind Blog

Google DeepMind和Kaggle推出了Kaggle Game Arena,一个开源的AI基准测试平台,让大型语言模型在策略游戏中进行对抗,从而提供动态的、可验证的能力评估。该平台通过提供明确的胜负条件和清晰的性能信号,克服了传统基准测试的局限性。

教人工智能模型说“我不确定”

MIT News — Artificial Intelligence

MIT CSAIL 研究人员提出 RLCR 方法,在强化学习中引入布雷尔分数(Brier scores),训练 AI 模型输出经过校准的置信度估计,在显著降低过度自信的同时,不牺牲准确率。

SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展

arXiv cs.AI

SMAC-Talk 是一个新的基准测试,在星际争霸多智能体挑战的基础上进行扩展,旨在评估基于 LLM 的智能体在具有自然语言通信的协作多智能体环境中的表现。该基准包含带有欺骗性通信者的场景,并使用 Qwen3.5 系列模型对智能体进行基准测试,以研究推理能力、记忆机制和模型规模对协调效果的影响。