标签
这则 PSA 提醒 DeepSeek-V4-Flash-0731 用户:系统角色消息会被提升到最顶部,破坏提示缓存和邻近性,并建议改用 latest_reminder。
最近的llama.cpp提交破坏了旧版DeepSeek V4 gguf聊天模板中的preserve_thinking行为,导致在编码代理环境中出现问题。解决方法是使用--chat-template-file覆盖gguf模板,替换为新的模板。
Laguna S-2.1模型已更新,修复了yarn_attn_factor(已修正为1.0),并改进了聊天模板,修复了损坏的思维过程、保留了思维链,并支持工具调用。建议用户使用官方仓库中更新的GGUF文件。
报告了 Laguna S 2.1 中的一个 bug:当 preserve_thinking 被禁用时,推理阶段会失败,并建议对比 Qwen 27B 的聊天模板来修复此问题。
分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。
用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。
Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。
Google 的 Gemma 4 31B IT 模型现在更新了聊天模板,支持保留思考过程,并改进了空值处理、推理保留和输入验证。
提出搭便车假说,认为对话模板标记(chat-template tokens)可能导致大型语言模型(LLMs)中的涌现性失调,并引入了令牌正则化微调(TReFT)来缓解这一问题,同时保持域内学习。
Gemma 4 12B 在工具调用和编程方面存在已知问题,但在 llama.cpp 中使用自定义聊天模板可以解决这些错误。用户应在评估模型的编程能力之前,从源码编译 llama.cpp 并应用此修复。
一个新的在线工具Chat Template Playground,让用户可视化查看不同开源LLM渲染其聊天模板的方式,突出显示了提示和分词上的差异。
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
本文系统性地探究了在LLM解码过程中,何时以及提示KV缓存的哪些部分变得可舍弃,表明冗余主要涉及聊天模板脚手架而非任务内容,并且用中性填充内容进行替换可保持准确性。
一位开发者分享说,解决多轮强化学习中的“tito”问题比普遍认为的要简单,只需要一个实现规则和一个所有模型已经支持的聊天模板属性。
作者在 Pacman 编程基准测试上测试了 Qwen 3.6 27b F16,三次尝试中有两次达到了近乎完美的结果,同时指出了量化、聊天模板和推测解码对本地自主编程的关键影响。
该仓库为 Qwen 3.5 和 3.6 提供了修复后的 Jinja 聊天模板,解决了官方模板在 LM Studio、llama.cpp 等引擎中的渲染错误、token 浪费和功能缺失问题。