每美元智能是新的扩展定律:一个小型推理模型在Arc-AGI 1上突破现有成本-精度帕累托前沿

Reddit r/artificial 模型

摘要

Chart Pathway的BDH-CQ,一个150M参数的推理模型,在ARC-AGI-1上达到了29.5%的准确率,每任务成本远低于像GPT-5.6 Luna这样的大型模型,展示了成本-精度权衡的改进。

Chart Pathway,一个构建后变换器架构和模型的人工智能实验室,发布了BDH-CQ的基准测试结果,这是一个150M参数的推理模型。BDH-CQ在公开的ARC-AGI-1评估集上获得了29.5%的pass@2成绩,计算推理成本为每任务0.0007美元。它的每任务运行成本大约是GPT 5.6 Luna (Low)的11分之一,即使在考虑了OpenAI于7月30日对5.6 Luna进行的80%降价之后。Luna得分34.2%,对比BDH-CQ的29.5%,这是一个在成本11倍的情况下获得的适度精度提升。他们还报告了从1B到600B参数的早期预训练实验,同时保留了BDH-CQ特有的潜在推理能力。它通过结合上下文学习和循环潜在推理来实现,而不是将每个中间结果语言化。
查看原文

相似文章

BDH-CQ:结合循环潜在推理的上下文学习

Hugging Face Daily Papers

本文介绍了BDH-CQ,一个150M参数规模的推理模型,它将上下文学习与循环潜在推理相结合,在ARC-AGI-1上以极低的推理成本实现了29.5%的pass@2,确立了新的成本-精度前沿。