@VraserX:Fable 5.1 在基准测试中表现确实令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是……
摘要
这条推文评论了 Fable 5.1 在代理研究和编码方面的出色基准测试,但认为这只是渐进式的改进,表达了对 OpenAI 的 Astra 的更多兴趣,因其潜在的持久记忆。
Fable 5.1 在基准测试中看起来真的很令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是渐进式的一步,而不是范式转变。
我更加好奇 OpenAI 的 Astra。如果它真的能够以接近持久记忆的方式无限运行,那将比又一次基准测试提升重要得多。
查看缓存全文
缓存时间: 2026/09/02 13:55
Fable 5.1在基准测试中的表现确实令人印象深刻,尤其是在智能体研究和编码方面,但这仍感觉像是渐进式的进步,而非范式的转变。
我更感兴趣的是OpenAI的Astra项目。如果它真的能实现近乎持续记忆的无限期运行,这意义可要比又一次基准测试提升深远得多。
相似文章
Fable 5 位居 KernelBench 榜首。Jack Clark 称其为“RSI 循环的起点”
Fable 通过编写高效 CUDA 超内核(megakernel),实现 18.71 倍加速,登上 KernelBench-Mega 榜首,标志着 AI 研发向递归自我改进迈出一步。
@heyshrutimishra: 1. Fable 5 在几乎所有重要基准测试中都是最先进的。软件工程。科学。知识工作。视觉……
Anthropic 发布了 Fable 5,声称它在软件工程、科学、知识工作和视觉等关键基准测试中达到了最先进水平,超过了所有先前可用的模型。
这周大家都在试图抢Fable 5.1的风头,哈哈
这条推文评论了近期AI相关发布,如Atlas、Astra和Grok 4.6,如何在本周抢了Fable 5.1的风头。
Fable 5 基准测试(使用 remotion 视频)
Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。
我用了半天的Fable 5,发现护栏才是真正的故事
Anthropic的Fable 5模型展现了令人印象深刻的推理和上下文处理能力,但存在高延迟、高成本以及在特定领域静默回退到Opus 4.8的问题,这可能会中断工作流程。