Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
摘要
# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。
查看缓存全文
缓存时间: 2026/04/21 07:21
论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
来源:https://huggingface.co/papers/2604.17696
作者:,,,,,,,,,,
摘要
STRATAGEM 通过引入“推理可迁移性系数”和“演化奖励”,鼓励抽象、跨领域的通用模式,而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。
游戏为培养语言模型的通用推理能力提供了理想范式,天然要求战略规划、概率推理与自适应决策。然而,现有自博弈方法仅依赖最终胜负信号,无法区分可迁移的推理模式与博弈专用启发式。我们提出 STRATAGEM,针对推理迁移的两大根本障碍:领域特异性(所学模式受限于博弈语义)与情境静态(静态博弈情境无法促进渐进推理)。STRATAGEM 通过推理可迁移性系数选择性强化展现抽象、跨领域推理的轨迹,并利用推理演化奖励激励自适应推理能力的发展。在数学推理、通用推理与代码生成基准上的实验表明,STRATAGEM 显著提升性能,尤其在需要多步推理的竞赛级数学任务上增益最强。消融实验与人工评估均证实,两大组件共同促进了可迁移推理。
查看 arXiv 页面 (https://arxiv.org/abs/2604.17696)
查看 PDF (https://arxiv.org/pdf/2604.17696)
GitHub0 (https://github.com/ydyyyy/Stratagem)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17696)
在智能体中获取该论文:
hf papers read 2604.17696
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2604.17696 即可在此页面显示链接。
收录该论文的合集 0
暂无合集收录该论文
将该论文添加到合集即可在此页面显示链接。
相似文章
GENSTRAT:迈向大型语言模型战略推理科学
本文介绍了GENSTRAT,一个利用程序生成的战略环境来评估LLMs在多维度上的战略推理能力的基准,解决了固定游戏套件的局限性。
通过自我调节的模拟规划实现高效代理推理
介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。
超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization
介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。
STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统
STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。
推理之旅:剖析思维链如何在模型间转移
本文研究了思维链推理痕迹如何在不同模型间转移,采用受控的提供者-接收者框架来剖析成功转移背后的机制。