@VraserX:Fable 5.1 在基准测试中表现确实令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是……

X AI KOLs Following 新闻

摘要

这条推文评论了 Fable 5.1 在代理研究和编码方面的出色基准测试,但认为这只是渐进式的改进,表达了对 OpenAI 的 Astra 的更多兴趣,因其潜在的持久记忆。

Fable 5.1 在基准测试中看起来真的很令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是渐进式的一步,而不是范式转变。 我更加好奇 OpenAI 的 Astra。如果它真的能够以接近持久记忆的方式无限运行,那将比又一次基准测试提升重要得多。
查看原文
查看缓存全文

缓存时间: 2026/09/02 13:55

Fable 5.1在基准测试中的表现确实令人印象深刻,尤其是在智能体研究和编码方面,但这仍感觉像是渐进式的进步,而非范式的转变。

我更感兴趣的是OpenAI的Astra项目。如果它真的能实现近乎持续记忆的无限期运行,这意义可要比又一次基准测试提升深远得多。

相似文章

Fable 5 基准测试(使用 remotion 视频)

Reddit r/singularity

Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。