qwen agentworld 可以在推理轨迹中自我纠正
摘要
一位用户尝试了 Qwen AgentWorld,发现了一个系统提示,可以在推理轨迹中实现自我纠正,经典洗车测试就是例证。
我决定随便玩玩,看看世界模型训练如何影响它。发现了一个能大幅改进推理的系统提示:预测你自己的回答,然后分析你的预测是否存在任何错误。利用该分析来构建最终回答。仅输出最终回答,不要重复思考过程。尝试了经典的洗车测试,这是 35b-a3b 模型大多数时候都会失败的问题。以下是推理追踪,我觉得挺酷的:
洗车场距离我家 100 米。我应该走路还是开车?
思考过程:
分析请求:用户问:“洗车场距离我家 100 米。我应该走路还是开车?”
约束 1:预测你自己的回答,然后分析你的预测是否存在任何错误。
约束 2:利用该分析来构建最终回答。
约束 3:仅输出最终回答,不要重复思考过程。
预测自己的回答(初始思考过程):
初始预测:我可能会说,既然洗车场只有 100 米远,步行比开车更高效、更实际。开车这么短的距离很不方便,浪费时间找停车位,而且走路只需一两分钟,完全没有必要。
起草初始回答(在脑中或草稿中):“你绝对应该走路。100 米大约只需步行 1-2 分钟。开车这么短的距离很不方便,因为你得启动汽车,从车道或街道驶出,还要在洗车场找停车位,这比走路慢多了。”
分析预测中的错误:
说“走路”有错误吗?等等是的。目的地是洗车场。如果你走路去洗车场,怎么洗车?你需要把车开到洗车场。所以如果洗车场离家 100 米,你必须开车(或让别人开)你的车去洗车场,或者把车“走”过去?不,你要开车去洗车场。等等,车在家里吗?是的,“洗车场距离我家 100 米。”所以用户的汽车在家里。要洗车,他们需要把车开到洗车场。你不能“走”一辆车(除非用拖车或推车,但那不标准)。等等,他们是否在问是否应该走路去洗车场交车钥匙或进入店内,而车由别人开?还是这个问题是个陷阱?“我应该走路还是开车?”如果洗车场离家 100 米,并且你需要洗车,你必须开车。你不能把车留在家里自己走去洗车场,除非你是步行去做别的事情。但上下文暗示是为了洗车。所以你必须开车。等等,有可能“走”车吗?不。所以答案应该是:你应该开车去洗车场,因为那是洗车场——你需要把车辆开到那里清洗。如果你想要洗车,走路不是一个选项,除非你走路旁边有人帮你开车,但一般来说,你要开车。让我们再仔细读一遍:“洗车场距离我家 100 米。我应该走路还是开车?”如果目的地是洗车场,目的就是洗车。因此,你必须把车开到洗车场。你无法“走”一辆车到洗车场。所以正确答案是:你应该开车(你的车),因为那是洗车场,你需要你的车辆在那里清洗。走路会把你的车留在家里,无法清洗。
优化分析:
初始预测中的错误:初始预测假设用户是在询问作为一个行人去该地点办个人差事或拜访,忽略了目的地是洗车场这一事实,这意味着目的是清洗车辆。因此,用户必须开车去洗车场;如果目标是洗车,走路不是可行选项。
构建最终回答:
最终回答必须只包含最终回答,不要重复思考过程,不要在输出中包含预测/分析文本。只输出最终答案。
最终答案表述:“你应该开车去洗车场。因为目的地是洗车场,你需要你的车辆在那里清洗,所以如果你目标是洗车,走路不是一个选项。”
双重检查约束:
“预测你自己的回答,然后分析你的预测是否存在任何错误。利用该分析来构建最终回答。”——已在思考过程中完成。
“仅输出最终回答,不要重复思考过程。”——确保输出只包含最终回答,没有诸如“预测:”、“分析:”等元文本。
最终润色回答:
“你应该开车去洗车场。因为目的地是洗车场,你需要你的车辆在那里清洗,所以如果你目标是洗车,走路是不切实际的选择。”(保持简洁直接)。让我们确保它直接回答了“我应该走路还是开车?”——>“你应该开车去洗车场……”等等,有没有可能用户已经在车里了?“洗车场距离我家 100 米。我应该走路还是开车?”如果他们在家里,车也在家。要洗车,他们必须开车。所以:“你应该开车去洗车场。因为目的地是洗车场,你需要你的车辆在那里清洗;走路会把车留在家里。”让我们确保自然:“你应该开车去洗车场。因为去洗车场是为了清洁你的车辆,你必须开车去那里——如果你想洗车,走路不是选项。”让我们优化:“你应该开车去洗车场。由于目的地是洗车场且目标是清洁你的车辆,你需要把车运到那里,因此开车是唯一实际的选择。”等等,如果他们在问是否应该走路去洗车场而让另一个人开车呢?或者走路 vs 开车是指他们应该步行 100 米还是开车 100 米?但你不能“走”一辆车。如果他们在问个人去洗车场的交通方式(例如去交钥匙),但通常你要开车通过洗车机。所以开车是唯一合乎逻辑的答案。让我们确保回答是:你应该开车去洗车场。因为去洗车场的目的是清洁你的车辆,你必须开车去那里;如果你想洗车,走路不是一个选项。
你应该开车去洗车场。因为去洗车场的目的是清洁你的车辆,你需要把车运到那里,因此开车是唯一实际的选择。
成功预测了自己会犯的错误,并纠正了错误。作为对比,使用相同的系统提示,普通的 qwen3.6 35b-a3b 预测了其输出,但未能发现逻辑错误,回答如下:你应该走路。100 米(约 330 英尺)的距离步行大约需要 60-90 秒,而开车则会增加不必要的时间,用于启动汽车、从车道或街道驶出、停车以及回到车内。走路还零成本、更环保,并避免了在非常近的地方找停车位的麻烦。除非你遇到极端天气、携带重型设备或多件行李、或有行动不便使得走路不切实际,否则开车。否则,走路显然是更快、更高效的选择。
相似文章
@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
Qwen/Qwen-AgentWorld-35B-A3B
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
Qwen-AgentWorld: 通用智能体的语言世界模型
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
从智能体轨迹中诱导推理原语
介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。