获取、修复、保存:一种诊断引导的小模型对话游戏代理后训练方案

Hugging Face Daily Papers 论文

摘要

本文研究了一款用于对话游戏的2B模型的失败案例,并介绍了一种诊断引导的后训练方案,该方案使用SFT、DPO和LoRA来提升性能,同时保持通用能力。

交互式对话游戏测试了一种静态基准大体上未明确指出的能力:模型必须在多轮对话中维护状态、解释反馈,并在变化约束下选择有效动作。我们在LM Playschool Challenge中使用一款2B开源权重模型研究了这一场景,发现许多失败不仅是广泛的知识缺失,还有局部决策失败:重复猜测、格式错误的动作以及违反模型刚刚看到的反馈。这些诊断结果启发了一种围绕三个步骤组织的训练方案:通过监督微调获取广泛的游戏参与,使用回合局部偏好对修复针对特定对话游戏族系内可机械验证的失败,并保存超出这些对话游戏的通用能力。在官方最终评估中,我们的提交将公开clemscore从10.67提升至38.92,闭域分数从13.41提升至41.17,同时大致保持了聚合静态性能(基线为44.24,我们的为44.14)。域外clemscore仍较低,为7.88,最大增益集中在目标族系的未见变体中。我们的结果表明,广泛的SFT带来了模型能力的大部分提升;当失败检测精确时,回合局部监督可能有效,观察到的转移主要集中在族系内部。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:57

论文速览 - 获取、修复、保持:面向小型对话游戏智能体的诊断引导后训练方案

来源:https://huggingface.co/papers/2608.28458

我们研究了2B参数模型在交互式对话游戏中失败的原因,发现失败不仅源于知识缺失,更存在局部决策错误——例如重复猜测、动作格式错误、忽略模型刚接收的反馈指令。由于这些错误具有机械可检测性,我们将监督机制精准部署于此:通过广泛监督微调使模型掌握游戏参与能力;针对单一游戏类型,利用轮内直接偏好优化对(相同历史背景,一个决策被破坏)修复诊断出的失败模式;并通过无训练缩放学得的LoRA增量来保持模型通用能力。

官方最终评估结果:公开clemscore评分从10.67提升至38.92,封闭领域内评分从13.41提升至41.17(超越4B和9B基线模型),静态性能基本保持稳定(44.14对44.24)。领域外迁移评分仍较低(7.88)——性能提升集中于目标游戏类型内。

模型地址:https://huggingface.co/chnln/Qwen3.5-2B-playpen-playornotplay

相似文章

Dialogue SWE-Bench:对话驱动编码代理的基准测试

arXiv cs.CL

提出了 Dialogue-SWE-Bench,这是一个用于评估编码代理通过与用户对话解决软件工程问题能力的基准测试。该研究还提出了一种基于角色设定的用户模拟器和一个能够提升对话能力的模式引导型代理。