POLARIS:引导小模型写长篇故事
摘要
POLARIS 是一套训练方案,结合 GRPO 与 LLM-as-judge 奖励机制及人类参考注入技术,旨在提升小模型的长篇故事生成能力。将其应用于 Qwen3.5-9B 后,所得到的 POLARIS-9B 模型在创意写作基准测试中达到了 Qwen3.5-27B 的水平,同时在遵循长度指令方面表现更佳。
arXiv:2606.04095v1 Announce Type: new
Abstract: 小型开放权重模型在长篇创意写作方面表现欠佳:生成的故事要么远达不到要求的长度,要么随着长度增加质量显著下降,与前沿模型相比尤为明显。我们提出 POLARIS(基于 LLM-as-a-judge 奖励与锚定参考注入的故事写作策略优化方法),这是一套计算开销较低的 GRPO 方案,包含两个核心要素:以前沿 LLM 作为评判者,采用结构化故事质量评分标准作为在线奖励;以及人类参考注入(HRI)机制——在每个 GRPO 组内,将经过教师强制的人类撰写故事作为高奖励锚点。我们将该训练方案应用于 Qwen3.5-9B,使用从 100 部短篇小说选集中提取的约 1.4K 条提示-故事对作为数据集,并借助 4 块 A100 GPU 进行训练,最终得到 POLARIS-9B。在涵盖分布内与分布外提示及评分标准的五项基准测试中,POLARIS-9B 在更严格遵循长度指令的同时,与体量大得多的开放权重模型相比仍具有竞争力。盲测人工评估进一步证实,POLARIS-9B 优于基础版 Qwen3.5-9B,并与 Qwen3.5-27B 不相上下。尽管训练数据仅包含不超过 4k 词的故事,POLARIS-9B 在处理要求长度达训练长度 3 倍的提示时仍能保持较高质量——而在这一区间,大多数开放权重模型的质量、长度遵循度或两者均会大幅下降。更广泛地看,我们的实验结果表明,长度泛化能力是评估创意写作模型的一项有意义的压力测试,也是区分性能相近模型的有效视角。
查看缓存全文
缓存时间: 2026/06/05 02:12
# POLARIS:引导小模型创作长篇故事 来源:https://arxiv.org/abs/2606.04095 查看PDF (https://arxiv.org/pdf/2606.04095) > **摘要:** 小型开放权重模型在长篇创意写作方面表现欠佳:生成的故事要么远未达到要求的长度,要么随着长度增加质量显著下滑,与前沿模型相比尤为明显。我们提出了 POLARIS(基于 LLM 评判奖励与锚定参考注入的故事写作策略优化,Policy Optimization with LLM-as-a-judge rewards and Anchored-Reference Injection for Storywriting),这是一种低算力的 GRPO 训练方案,包含两个核心要素:以前沿 LLM 作为评判者,采用结构化故事质量评分标准作为在线奖励;以及人类参考注入(HRI),即在每个 GRPO 组内将经过教师强制的人类书写故事作为高奖励锚点。我们将该训练方案应用于 Qwen3.5-9B,使用从 100 部短篇小说选集中提取的约 1,400 个提示-故事对数据集,并借助 4 块 A100 GPU,最终得到 POLARIS-9B。在涵盖分布内和分布外提示与评分标准的五个基准测试中,POLARIS-9B 在与更大规模开放权重模型相比具有竞争力的同时,也能更好地遵循长度指令。盲测人类评估结果证实,POLARIS-9B 优于基础版 Qwen3.5-9B,与 Qwen3.5-27B 不相上下。尽管训练时仅使用了不超过 4,000 词的故事,POLARIS-9B 在面对要求生成训练长度最多 3 倍故事的提示时仍能保持质量,而在这一范围内大多数开放权重模型的质量、长度遵从性或两者均会大幅下降。更广泛地来看,我们的结果表明,长度泛化能力是创意写作模型的一项有意义的压力测试,也是区分原本难分伯仲模型的有效视角。 ## 提交历史 来自:Rishanth Rajendhran \[查看邮箱 (https://arxiv.org/show-email/70dede27/2606.04095)\] **\[v1\]** 2026年6月2日(周二)18:00:07 UTC(7,952 KB)
相似文章
小型模型是GRPO中策略级多样性的自然探索器
S2L-PO框架利用小型模型作为自然探索器,增强GRPO中的策略多样性,以训练大型语言模型。它实现了更快的收敛,并在降低rollout计算量的同时,提高了数学推理基准的准确性。
@HuggingModels: 是否曾想过拥有一个结合了Qwen的推理能力、Opus的创造力以及GLM的高效性的模型?欢迎认识Qwen-3.5-Opus-GLM-27B…
Qwen-3.5-Opus-GLM-27B是一个270亿参数的GGUF合并模型,融合了Qwen的推理能力、Opus的创造力以及GLM的高效性,专为无需云依赖的高性能本地AI设计。
在两块 Tesla P40 上运行双模型文学翻译流水线:gemma-4-26B-A4B 达到约 40 词元/秒,配合 MTP 规范解码的 Qwen3.6-35B-A3B 则达到 50-70 词元/秒——完整 llama-server 参数见下文。
该文章详细介绍了一款名为"Sunny Narrator"的开源工具,该工具利用基于Tesla P40 GPU的双模型AI流水线翻译小说,并通过优化的llama-server配置与MTP投机解码技术,实现了每秒40-70个token的生成速度。
Qwen 3.6 27B:本地开发的理想之选
Qwen 3.6 27B 被赞誉为强大的本地 AI 模型,在通用智能方面超越预期,适用于代码生成等实际任务,并能通过 llama.cpp 轻松运行。
Qwen-3.8-27B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Muse-Glimmer-30B oQ8e 对比
对比了多个AI模型,包括Qwen、Nemotron、Ornith和Muse-Glimmer在基准测试上的表现。Ornith表现优异,而TielCoder在编程任务中展现了潜力。