为何 DiffusionGemma 在工具调用上可能优于其基准质量所暗示的表现

Reddit r/LocalLLaMA 模型

摘要

分析了 DiffusionGemma 的双向注意力和并行块生成如何由于其能够修正 token 的能力,可能产生更高的有效工具调用率,尽管其基础质量低于 Gemma 4。

大多数讨论都集中在 4 倍速度上。谷歌自己表示其质量低于 Gemma 4,并建议生产环境使用 Gemma 4。这很合理。但速度并不是我所关注的。它通过双向注意力并行生成一个 256 token 的块,因此可以在最终确定块之前修正已经放置的 token。自回归解码无法做到这一点。一旦 AR 模型发出一个花括号或字段名,它就固定了,如果出错,唯一的路径就是失败,或者在前面加一个修复层和重试。结构化输出正是这一点至关重要的地方。一个格式错误的工具调用通常是在一个本来正确的序列中出现一个错误的 token,而一个能够回顾整个块并进行自我纠正的模型具有结构性修复的机会,这是从左到右模型永远无法获得的。因此,这里的解码特性比质量评分更有趣。值得测试的是,尽管基础质量低于 Gemma 4,双向自我纠正是否能带来更高的有效工具调用率。是否有人实际对工具调用做过基准测试,看看双向画布是否能修复破损的 JSON,还是说较低的基础质量意味着它只是生成了结构良好的垃圾?
查看原文

相似文章

Diffusion Gemma 速度快4倍,但错误多6倍!

Reddit r/LocalLLaMA

一项基准测试显示,Diffusion Gemma 比 Gemma4 速度快4倍,但事实性错误多6倍,尤其是在冷门话题上,为了生成流畅文本而牺牲了事实准确性。

DiffusionGemma 技术报告

arXiv cs.CL

DiffusionGemma 是一个实验性的开放权重语言模型,通过离散扩散而非逐 token 解码来生成文本,从而实现极高速的生成。

DiffusionGemma:开发者指南 - Google Developers Blog

Reddit r/LocalLLaMA

DiffusionGemma 是 Google DeepMind 推出的全新实验模型,可在 256 令牌画布上实现并行生成,在 GPU 上令牌生成速度提升高达 4 倍。本开发者指南阐述了其架构、双向上下文,并提供了用于解决数独的微调配方。

DiffusionGemma: 文本生成速度提升4倍

Hacker News Top

Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。