LLM辩论是否在不同语言中以不同方式重复论点?
摘要
本文研究LLM辩论是否在不同语言中以不同方式重复论点,分析论点重复在多语言环境中的变化情况。
arXiv:2607.23442v1 Announce Type: new
Abstract: LLM辩论通常通过最终答案来评估,但对话记录也能揭示后续轮次是发展新的论证内容还是以新的措辞回到先前的论点。我们使用\textit{先前论点相似度}来研究这一过程,这是一种汇总诊断方法,将提取的论点单元与同一辩论中的早期单元进行比较。在针对71个议题、六种语言和四个模型代理的受控八轮辩论中,中文是唯一在三种多语言嵌入模型上相对于英文始终存在正差距的测试语言。该差距在代理、轮次位置、回归调整、指标变体、提取长度控制、第二提取器子集和交叉编码器尾部重新评分中持续存在。手动校准显示项目级对齐较弱,但高相似度尾部富含实质性重复。一种多样性感知提示降低了所有语言中的先前论点相似度,但并未显著缩小中英文差距。这些发现表明,多语言辩论评估应随时间衡量论证发展,并在平均和差距项中报告缓解效果。
查看缓存全文
缓存时间: 2026/07/28 06:29
# 不同语言的大模型辩论是否重复相同的论点? 来源:https://arxiv.org/abs/2607.23442 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据与媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区协作者合作的实验性项目 arXivLabs 是一个框架,允许协作者直接在我们的网站上开发和共享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都已接受并认同我们关于开放性、社区性、卓越性以及用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有一个能为 arXiv 社区带来价值的项目想法?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
多语言中数学推理的LLM参数:共享还是独立?
本文提出了一种跨语言的LLM数学推理机制分析,发现数学相关参数在不同语言之间存在部分重叠,主要集中于中间层。英语拥有最大规模的数学相关参数集,而低资源语言则拥有较小的参数集。
Cross-LLM推理一致性:来自共享交互的证据
本文利用基于交互的解释方法,研究了不同LLM在预测相同词元时是否共享共同的推理模式。结果表明,先进LLM展现出一致的交互模式,暗示它们隐式地优化到了共享的推理机制。
评判者更喜欢英语吗?评估LLM作为评判者的语言切换不变性
本文提出了Judge-LS,一种评估LLM-as-a-judge模型在英语和中文之间语言切换是否不变的协议。研究发现,语言切换会导致10.7%至14.4%的偏好翻转,且评判者在英语中达到最高准确率。
mmPISA-bench:LLMs 在43种语言中的推理能力是否同样出色?
介绍 mmPISA-bench,一个源自PISA的紧凑型多语言推理基准,评估了专有LLMs在43种语言上的表现,发现它们能有效推理但存在一些性能差异,且机器翻译的问题不会降低准确率。
迈向超越英语中心化开发的大语言模型
本文证明了大语言模型严重偏向英语,并表明持续预训练在将模型适配到其他语言(尤其是文化理解方面)时,并不比从头训练更具成本优势。