@dair_ai: // 行动胜于言语 // 多语言智能体评估比较最终答案,却将轨迹丢弃…

X AI KOLs Timeline 论文

摘要

微软研究院的新研究通过比较动作轨迹而非最终答案,来衡量使用工具的智能体的跨语言策略保留率。在去除五个混淆因素后,四个前沿模型在跨语言条件下保留了71%–73%的动作策略,并发布了代码和238万次rollout数据。

// 行动胜于言语 // 多语言智能体评估会比较最终答案,却把轨迹丢弃了。轨迹决定了成本、延迟、失败模式和可审计性。 微软研究院的新研究将动作策略作为衡量对象。8个模型、6个平行基准、41种语言、238万次rollout。 原始轨迹相似性与任何站得住脚的论断之间存在五个混淆因素。短轨迹得分更高,空轨迹获得完美分数,不相关的轨迹在超过一半的情况下会偶然一致,可复现性限制了差距,而且一个模型在同一语言中被询问两次会给出不同答案。去除全部五个因素后,效应变得更明显。 按照自身可复现性进行归一化后,四个前沿模型在跨语言条件下各自保留了其动作策略的71%至73%。 论文:https://arxiv.org/abs/2608.11110 在我们的学院中追踪更多热门AI论文:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/12 22:34

// 行动胜于言语 //

多语言智能体评估比较最终答案,却把轨迹丢弃了。轨迹决定了成本、延迟、失败模式与可审计性。

微软研究院的新研究将行动策略作为被测量的对象。8个模型、6组并行基准、41种语言、238万次展开。

在原始轨迹相似性与任何站得住脚的结论之间,存在五个混杂因素。短轨迹得分更高,空轨迹完美得分,无关轨迹的偶然一致率超过一半,可复现性封顶了差距,还有一个模型在同一语言中被问了两次却给出不同答案。移除全部五个因素后,效应反而更大。

按模型自身的可复现性归一化后,四个前沿模型在跨语言条件下各自保留了行动策略的71%至73%。

论文:https://arxiv.org/abs/2608.11110

在我们的学院中追踪更多热门AI论文:https://academy.dair.ai


行动胜于言语:测量工具使用智能体的跨语言策略保持度

来源:https://arxiv.org/html/2608.11110 Sourabrata Mukherjee、Kalika Bali、Sunayana Sitaram 微软研究院印度 [email protected]

摘要

当一个使用工具的智能体被给予不同语言的同一任务时,它是否仍然会采取相同的步骤?多语言评估很少问这个问题,因为它比较最终答案,然后把中间动作丢弃了。对于一个智能体来说,这些动作就是产品本身:路径决定了成本和延迟,决定了系统如何失败,也是审查者唯一能够审计的行为部分。因此,两个语言版本即使在每个答案上都一致,仍可能在代价、失败模式以及针对其中一个版本编写的安全防护是否对另一个版本有效等方面存在差异。因此,我们让行动策略本身成为被测量的对象,横跨8个模型、6组并行基准和41种语言(238万次智能体展开)。朴素测量行不通,因为在原始轨迹相似性与任何站得住脚的结论之间,存在五个混杂因素,每一个单独都足以改变结论:短轨迹比长轨迹得分更高,空轨迹完美得分,无关轨迹仅因偶然因素就有一致率超过一半,差距被每个模型自身的可复现性所封顶,以及最糟糕的是,一个模型在同一语言中被问了同样的问题两次,回答却不一致,因此没有可供比对的参考点。我们重建了测量方法以移除全部五个因素,而每项修正都让效应变得更大而非更小。跨语言分歧由此被证明是结构性的而非采样噪声:在我们测试的每个单元中,它即使在贪婪解码下也依然存在,并且随着温度升高而保持平稳,尽管模型自身的自一致性大幅下降。按每个模型自身的可复现性归一化后,四个差异很大的前沿模型在贪婪解码下几乎收敛到相同的数值,每个模型在语言变化时保留了行动策略的71%至73%,而模型身份只解释了5.7%的方差。在大约100亿参数以下,这种规律性被打破,而较小模型间的表观排序在很大程度上是机会底板的产物——这个底板是我们通过置换来测量而非假设的。追问原因时,我们发现智能体会将非英语任务经由英语中转,这种中转具有因果承载作用(预测已提前登记,并在四个模型上得到验证),而且即使用指令要求,模型也不会放弃这一中转。最后,一个简单的轨迹提取正则表达式,而非模型本身,制造了一个明显的多语言失败:两个工作示例将某个模型的实测准确率提高了26倍,而该模型在可读输出上的准确率几乎没变。代码、提示词、两套基准的全部内容以及全部238万条逐次启动轨迹均已发布。¹¹代码、提示词和结果:仓库(https://github.com/souro/agent-actions-speak-louder-than-words)。数据:改编版(https://huggingface.co/datasets/Souro/agentic-tooluse-adapted-multilingual)和合成版(https://huggingface.co/datasets/Souro/agentic-tooluse-synthetic-multilingual)多语言智能体工具使用基准,均位于Hugging Face(https://huggingface.co/Souro)。关键术语定义见表A(https://arxiv.org/html/2608.11110#A1)、附录A(https://arxiv.org/html/2608.11110#A1)。

1 引言

语言模型越来越多地被部署为智能体:它们将任务分解为步骤、调用工具并组装结果(Yao等人 2023(https://arxiv.org/html/2608.11110#bib.bib32);Schick等人 2023(https://arxiv.org/html/2608.11110#bib.bib25);Parisi等人 2022(https://arxiv.org/html/2608.11110#bib.bib19);Qin等人 2024(https://arxiv.org/html/2608.11110#bib.bib23))。多语言发布一个智能体时,关键问题不仅在于它能否用印地语正确回答,还在于它是否会用印地语做同样的事情,与用英语时相同:它是否在计算之前检索、是否先翻译、是走三步还是八步。

这种差异并非表面功夫,因为对智能体而言,路径就是产品。一个在回答前先翻译段落的模型,会花费英语分支从未花费过的token和延迟,因此相同的请求在一种语言中比在另一种语言中更昂贵。不同的路径也会以不同方式失败:由该翻译步骤引入的错误只存在于非英语路径上,永远不会在英语回归测试中浮现。而且路径是智能体行为中真正可以被治理的部分,因为工具权限、速率限制、升级规则和审计追踪都是针对系统预期采取的动作序列来编写的。因此,在英语轨迹上验证的策略并不能描述系统在印地语中实际做了什么。这些都不意味着不同的语言应该总是产生相同的路径;有时确实不应该。它意味着这种差异必须是可以测量的,而今天它根本没有被测量,因为答案层面的对等可以与任意程度的路径差异共存。

多语言评估在这里几乎没有着力点。标准评测集比较最终输出(Hu等人 2020(https://arxiv.org/html/2608.11110#bib.bib10);Ahuja等人 2023(https://arxiv.org/html/2608.11110#bib.bib1);Liang等人 2023(https://arxiv.org/html/2608.11110#bib.bib13)),而智能体基准绝大多数是英语的(Liu等人 2024(https://arxiv.org/html/2608.11110#bib.bib14);Mialon等人 2024(https://arxiv.org/html/2608.11110#bib.bib15)),因此中间策略在两边都被丢弃了。我们让那个策略成为被测量的对象,并问:多语言工具使用模型对于跨语言的语义相同任务,是否执行相同的行动策略?图1(https://arxiv.org/html/2608.11110#S1.F1)总结了我们的回答方式。

我们测量什么一个规范任务,以41种语言呈现英语印地语运行1搜索计算完成运行2搜索计算完成翻译搜索完成翻译计算完成I_\{\text{within}},同语言内I_\{\text{cross}},跨语言两者都只比较运行1和运行2,因此唯一不同的是语言I~=I_\{\text{cross}}\,/\,I_\{\text{within}}在语言变化后保留下来的自一致性比例为什么朴素版本会失败C1没有基线模型自身不一致C2轨迹长度因果性的,66–77点C3空轨迹得分为1.01.0C4天花板r=\+0.97r=\+0.97C5机会底板已实测,c≈0.56c\approx 0.56虚线:以因果方式确定,而非假设+0.063\;\rightarrow\;+0.086\;\rightarrow\;\mathbf{+0.207}每项修正都让效应变得更大8个模型⋅\cdot6组并行基准⋅\cdot41种语言⋅\cdot505个单元⋅\cdot238万次展开图1:语义相同的任务以41种语言通过一个固定的符号化工具使用脚手架,每个单元生成两次,因此同语言和跨语言一致性以相同方式估计。轨迹仅供说明:印地语分支以英语中转开头,且同一种语言的两次运行彼此也不匹配,这正是为什么在跨语言数字有任何意义之前需要一个同语言基线。五个混杂因素存在于原始轨迹相似性与站得住脚的结论之间,其中四个单独就足以反转符号或排名。

这里困难的不是收集轨迹,而是解读它们:将任务渲染为多种语言、提取轨迹并平均其相似性,会得到一个不可信的数字,原因有五方面。四个是度量伪影:短轨迹比长轨迹得分更高,空轨迹完美得分,无关轨迹的偶然一致率已超过一半,且差距被模型自身的可复现性所限制。第五个则更为深刻。没有基线,因为一个模型以自身语言被问同样的问题两次,回答并不相同,而缺少那个参考点,这一量根本不可识别。

我们的协议修复了这一点。在一个共享五工具字母表的固定脚手架下,模型在生成答案的同时发出一个已执行的行动轨迹,我们比较的就是轨迹。我们在相同的解码、任务集和token预算下将每个单元生成两次,只改变服务种子。同语言一致性I_\{\text{within}}将一种语言中的两次重复配对;跨语言一致性I_\{\text{cross}}将它们跨语言配对。两边都是跨种子的,因此解码噪声以相同方式进入,语言是唯一的差异。归一化策略保持度是I~=I_\{\text{cross}}/I_\{\text{within}},即模型自身的可复现性在语言变化后保留下来的比例。每次比较都在两个方向上进行长度匹配,并且只有在两边符号一致时才被接受;只要任一轨迹为空,配对即被丢弃;置信区间是任务级自助法。估计器在附录中完整给出,五个混杂因素及其测得的成本在附录中,设计检查在附录中。

以这种方式修正后,效应变大而非变小。我们应用的每项修正都让它更大,从不更小。在贪婪解码下,所有24个单元中的差距都是正的,且原始差距的每个自助区间都排除零(图2(https://arxiv.org/html/2608.11110#S1.F2)),一个五点温度阶梯显示了采样此前如何掩盖了它:跨语言一致性随着温度升高几乎不动,而自一致性急剧下降。

除以那个天花板,得到本文的核心结果。在贪婪解码下,四个几乎毫无共同点的模型——相差一个数量级的规模、两种架构和完全不同的训练混合物——收敛到几乎相同的数值:每个模型在语言变化时都保留了自身行动策略的71%至73%。这种规律性逐单元成立,而不仅仅是逐模型成立,在所有24个单元中,模型身份只解释了极少的方差(5.7%)。将研究扩展到三个较小的和其他厂商的模型,显示了这种规律性的终点,以及为什么小模型之间的排序完全不能从原始指标上读出(§4(https://arxiv.org/html/2608.11110#S4))。

追问为什么发生,答案指向英语。智能体将非英语任务经由英语中转:在每一个改编基准中,翻译都是使用最多的工具,而且即使在天城文输入上,推理文本也几乎约\approx99%是ASCII。移除翻译工具会降低长度匹配一致性,降低幅度与模型使用它的程度成正比,而强制使用翻译则在一个预先登记的排序中有所帮助——该排序是根据每个模型测得的余量提前预测的。即使被直接要求放弃这一中转,模型也仍然坚持,合规率不足1%。这将对潜在英语处理的解释性发现(Wendler等人 2024(https://arxiv.org/html/2608.11110#bib.bib30);Zhao等人 2024(https://arxiv.org/html/2608.11110#bib.bib34))与执行动作层面的因果测试联系了起来。另外,一个简单的轨迹提取正则表达式,而非模型本身,在GPT-OSS-120B上制造了一个明显的多语言失败,我们在§6(https://arxiv.org/html/2608.11110#S6)中对其进行了拆解。

这项研究处于两个很少交汇的文献之间。基于ReAct式脚手架构建的智能体基准(Yao等人 2023(https://arxiv.org/html/2608.11110#bib.bib32);Schick等人 2023(https://arxiv.org/html/2608.11110#bib.bib25);Liu等人 2024(https://arxiv.org/html/2608.11110#bib.bib14);Mialon等人 2024(https://arxiv.org/html/2608.11110#bib.bib15))对结果评分,且绝大多数是英语的;而跨语言评测集(Hu等人 2020(https://arxiv.org/html/2608.11110#bib.bib10);Ahuja等人 2023(https://arxiv.org/html/2608.11110#bib.bib1);Liang等人 2023(https://arxiv.org/html/2608.11110#bib.bib13))比较最终预测;多语言思维链工作(Shi等人 2023(https://arxiv.org/html/2608.11110#bib.bib27);Muennighoff等人 2023(https://arxiv.org/html/2608.11110#bib.bib16))比较自由形式的文本,这很难对齐。我们让已执行轨迹成为被测量的对象,而共享的符号化动作字母表使其可比较。在精神上最接近的是Qi等人 2023(https://arxiv.org/html/2608.11110#bib.bib22),他们问模型是否跨语言检索相同的事实;我们问的是程序,并添加了匹配基线——没有它,该量根本不可识别(附录,附录中另有扩展比较)。

我们贡献了一个天花板校正的跨语言策略保持度估计量,以及一个在自身数据上为五个混杂因素各自定价的测量协议,其中两个是以因果方式而非假设方式建立的(附录和)。我们以使其能够被回答而非被敷衍的规模加以应用:238万次展开,覆盖505个单元,横跨8个模型、41种语言、五个温度和六项干预(§2(https://arxiv.org/html/2608.11110#S2))。我们证明了保持度规律是真实的,定位了它的边界,并证明了该边界以下模型之间的表观排序是一种度量伪影(§4(https://arxiv.org/html/2608.11110#S4))。我们还以因果方式建立了机制,关键预测已提前登记(§5(https://arxiv.org/html/2608.11110#S5))。

图2:核心结果。(a) 贪婪解码将I_\{\text{within}}提高了0.1340.134,但只将I_\{\text{cross}}移动了0.0050.005;细线是模型,粗线是合并均值。(b) 按每个模型的天花板相除,将T=0.5T{=}0.5处13.6个点的离散度压缩为T=0T{=}0处2.6个点的带状区间,附任务级自助95%置信区间。(c) T=0T{=}0处的全部24个单元都是正的,且原始差距的每个区间都排除零。

2 实验设置

跨语言比较策略要求x(li)(z)x^{(\ell_{i})}(z)和x(lj)(z)x^{(\ell_{j})}(z)是相同的任务,这是一个比看起来更强的条件,并且排除了大多数多语言语料库。英–X双文本将每种语言与英语配对,但不与其他语言配对,因此印地语分支的第i行和孟加拉语分支的第i行是不相关的句子。在我们筛选的语料库中,有五个直接未能通过这一测试,第六个以不同的行顺序存储其每种语言的配置,因此索引连接只能匹配一半条目。我们保留的套件是六个基于已验证对齐键的基准(FLORES-200(NLLB团队等人 2022(https://arxiv.org/html/2608.11110#bib.bib17))、XQuAD(Artetxe等人 2020(https://arxiv.org/html/2608.11110#bib.bib2))、XNLI(Conneau等人 2018(https://arxiv.org/html/2608.11110#bib.bib5))、Belebele(Bandarkar等人 2024(https://arxiv.org/html/2608.11110#bib.bib3))、XCOPA(Ponti等人 2020(https://arxiv.org/html/2608.11110#bib.bib20))以及一个专门构建的合成基准):5,776个任务、41种语言,涵盖17个语系和16种文字,以及809个语言对。我们将这五个重新利用的公共基准称为改编版,将专门构建的

相似文章

OmnilingualGAIA2:评估前沿AI智能体的多语言差距

arXiv cs.CL

本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。

当API说错语言:重新审视多语言工具使用的后训练

arXiv cs.CL

本文研究了多语言API调用中的“参数语言不匹配”(ALM)问题,即模型选择了正确的工具,但生成的参数值使用了不一致的语言。研究发现,监督微调是一个强大的基线,而强化学习仅带来增量改进。