获取、修复、保存:一种诊断引导的小模型对话游戏代理后训练方案
摘要
本文研究了一款用于对话游戏的2B模型的失败案例,并介绍了一种诊断引导的后训练方案,该方案使用SFT、DPO和LoRA来提升性能,同时保持通用能力。
查看缓存全文
缓存时间: 2026/09/01 11:57
论文速览 - 获取、修复、保持:面向小型对话游戏智能体的诊断引导后训练方案
来源:https://huggingface.co/papers/2608.28458
我们研究了2B参数模型在交互式对话游戏中失败的原因,发现失败不仅源于知识缺失,更存在局部决策错误——例如重复猜测、动作格式错误、忽略模型刚接收的反馈指令。由于这些错误具有机械可检测性,我们将监督机制精准部署于此:通过广泛监督微调使模型掌握游戏参与能力;针对单一游戏类型,利用轮内直接偏好优化对(相同历史背景,一个决策被破坏)修复诊断出的失败模式;并通过无训练缩放学得的LoRA增量来保持模型通用能力。
官方最终评估结果:公开clemscore评分从10.67提升至38.92,封闭领域内评分从13.41提升至41.17(超越4B和9B基线模型),静态性能基本保持稳定(44.14对44.24)。领域外迁移评分仍较低(7.88)——性能提升集中于目标游戏类型内。
模型地址:https://huggingface.co/chnln/Qwen3.5-2B-playpen-playornotplay
相似文章
Dialogue SWE-Bench:对话驱动编码代理的基准测试
提出了 Dialogue-SWE-Bench,这是一个用于评估编码代理通过与用户对话解决软件工程问题能力的基准测试。该研究还提出了一种基于角色设定的用户模拟器和一个能够提升对话能力的模式引导型代理。
当数据库失败时:在任务导向对话中提示LLM对话代理进行安全恢复
本文研究了一种轻量级的基于提示的恢复方法,用于后端数据库调用失败时的LLM对话代理,表明Guided-Retry策略在六个模型家族上,将MultiWOZ的幻觉降低了50%,SGD降低了42%。
用于演化角色扮演智能体的对抗性闭环课程
本文提出AdvRole,一种用于训练大型语言模型中角色扮演智能体的对抗性闭环课程框架,该框架通过演化场景池以提升在基准测试上的性能。
Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction
This paper introduces DARC, a diagnosis-guided recovery harness that makes agent self-correction selective by profiling failure modes and pruning mismatched interventions before test-time correction, improving performance on ALFWorld, AppWorld, and XBRL Finance.
Supersede: 诊断与训练LLM代理中的记忆更新缺口
介绍了Supersede,一个用于诊断和训练LLM代理中记忆更新差距的环境,表明标准模型无法在对话增长时维护当前事实,而GRPO微调可以提升性能。