@pwendell: 今天我们向Databricks的所有工程师(约3500人)推出了Astra。以下是一些可能对其他人有帮助的要点:1. Astra…

X AI KOLs Following 模型

摘要

Databricks推出了Astra,这是一款在复杂任务上超越先前模型并增加编码支出的人工智能模型,但在中等/低复杂度任务上未显示出显著改进。部署包括预算控制,以鼓励选择性使用以实现成本效率。

今天我们向Databricks的所有工程师(约3500人)推出了Astra。以下是一些可能对其他人有帮助的要点: 1. Astra在高度复杂任务上明确超越了我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长期横向任务相关的任务。 2. 使用Astra的工程师整体编码支出比基线增加了约60%。 3. 与早期模型相比,Astra在中等/低复杂度编码任务上的显著改进尚不明确。我们怀疑这些任务大多已由现有模型饱和(即完美执行)。 4. 我们通过与约200名用户试点Astra,以获取质量和成本方面的信号,从而学到了上述内容。我们使用Unity Gateway对所有新模型进行基于队列的实验。 5. 我们为工程师提供专门用于Astra的子预算,鼓励他们在复杂任务上选择性使用Astra,同时在日常任务中优先使用成本较低的模型。我们的工程师能够在整体预算范围内混合使用工具和模型(我们还通过各种机制允许增加预算)。这些预算在Unity Gateway中定义并定期重新审视。 注意:由于数据保留政策,我们尚未广泛推出Fable,因此没有Astra与Fable的可靠比较。
查看原文
查看缓存全文

缓存时间: 2026/09/17 04:12

今天我们已向Databricks的全部工程师(约3500人)部署了Astra。以下是一些对其他团队可能有用的经验总结:

  1. Astra在高度复杂的任务中显著超越了我们此前最先进的模型(Opus 5、Sol 5.6),尤其在涉及高层系统设计或长周期横向协调的任务中优势明确。

  2. 与基线相比,使用Astra的工程师整体编码工作量提升了约60%。

  3. 相较于早期模型,Astra在中低复杂度编码任务上的提升并不明显。我们推测这类任务已被现有模型基本优化至完善状态。

  4. 上述结论来自对200名工程师的试点研究,旨在同时评估质量与成本效益。我们通过Unity Gateway对所有新模型开展分组对照实验。

  5. 我们为工程师设立了Astra专属子预算,鼓励他们在复杂任务中选择性使用Astra,而日常任务则优先采用更经济的模型。工程师可在整体预算框架内灵活搭配使用不同工具与模型(我们还提供多种预算提升机制)。这些预算通过Unity Gateway配置并定期复核。

注:由于数据保留政策限制,Fable尚未全面推广,因此我们目前缺乏Astra与Fable的充分对比数据。

相似文章

Astra 太疯狂了。

Reddit r/openclaw

用户分享了他们在仪表盘中 Astra 快速修复 bug 的经历,超越了 Gemini 3.1 pro,并赞扬了 OpenAI 模型的能力。