为何 BQN 胜出
摘要
本文展示了一个基准测试,比较了 BQN 在奇数二元函数上的性能,并用现场演示突出了其优势。
<p>在这个 <a href="https://www.youtube.com/watch?v=7n262KKvHj8" rel="ugc">perf wars</a> 视频中,所有 BQN 解决方案都超越了其他方案,本文件解释了 BQN 所拥有的使其取得如此成就的优化。</p>
<p><a href="https://lobste.rs/s/lqelb1/why_bqn_wins">评论</a></p>
查看缓存全文
缓存时间: 2026/08/18 02:13
🥳 实时基准测试:点击此处 🥳
相似文章
@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
我对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 在 CPU 工具调用上进行了基准测试。1-bit 模型胜出,但仅在语法约束解码下。
对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 及其他模型在 CPU 工具调用上的独立基准测试显示,在语法约束解码下,Bonsai-8B 的通过率达到 92%,超越了更大的模型,但在无约束条件下失败。Granite 是原始表现最好的模型,通过率为 72%。
花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
ProgramBench Vetted:从可运行二进制文件进行逆向工程
ProgramBench Vetted 是一个包含50个任务的基准,用于评估AI代理从可运行二进制文件重构程序的能力,旨在研究长上下文协调并为强化学习提供密集奖励。
偏差累积,方差抵消
本文证明,对BF16优化器状态使用随机舍入可以匹配FP32性能,因为无偏误差随时间抵消,而四舍五入则因累积偏差而停滞。一项使用MLP的实验表明,BF16+SR在减少内存使用的同时达到了与FP32相似的损失。