Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

Hugging Face Daily Papers 论文

摘要

# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。

博弈为语言模型开发通用推理能力提供了极具吸引力的范式,因其天然要求战略规划、概率推断与自适应决策。然而,现有自博弈方法仅依赖终局结果,无法区分可迁移推理模式与博弈专用启发式。我们提出 STRATAGEM,针对推理迁移的两大根本障碍:领域特异性——所学模式仍锚定于博弈语义;情境静态——静态博弈情境无法培养渐进推理。STRATAGEM 通过“推理可迁移性系数”选择性强化展现抽象、跨领域推理的轨迹,并借“推理演化奖励”激励自适应推理发展。在数学推理、通用推理与代码生成基准上的实验显示显著提升,尤其在需多步推理的竞赛级数学任务中增益最强。消融实验与人工评估证实,两大组件均有助于可迁移推理。
查看原文
查看缓存全文

缓存时间: 2026/04/21 07:21

论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

来源:https://huggingface.co/papers/2604.17696
作者:,,,,,,,,,,

摘要

STRATAGEM 通过引入“推理可迁移性系数”和“演化奖励”,鼓励抽象、跨领域的通用模式,而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。

游戏为培养语言模型的通用推理能力提供了理想范式,天然要求战略规划概率推理自适应决策。然而,现有自博弈方法仅依赖最终胜负信号,无法区分可迁移的推理模式与博弈专用启发式。我们提出 STRATAGEM,针对推理迁移的两大根本障碍:领域特异性(所学模式受限于博弈语义)与情境静态(静态博弈情境无法促进渐进推理)。STRATAGEM 通过推理可迁移性系数选择性强化展现抽象、跨领域推理的轨迹,并利用推理演化奖励激励自适应推理能力的发展。在数学推理、通用推理与代码生成基准上的实验表明,STRATAGEM 显著提升性能,尤其在需要多步推理的竞赛级数学任务上增益最强。消融实验与人工评估均证实,两大组件共同促进了可迁移推理。

查看 arXiv 页面 (https://arxiv.org/abs/2604.17696)
查看 PDF (https://arxiv.org/pdf/2604.17696)
GitHub0 (https://github.com/ydyyyy/Stratagem)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17696)

在智能体中获取该论文:

hf papers read 2604.17696

尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

暂无模型关联该论文

在模型 README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。

引用该论文的数据集 0

暂无数据集关联该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。

引用该论文的 Spaces 0

暂无 Space 关联该论文

在 Space README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。

收录该论文的合集 0

暂无合集收录该论文

将该论文添加到合集即可在此页面显示链接。

相似文章

STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统

arXiv cs.CL

STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。