标签
顶尖理论物理学家 Yuji Tachikawa 报告称,Claude Fable 解决了一个困扰他和合作者六个月的研究问题。
GPT-5.6 在一个关于梯度流长度的基础数学问题上显著超越了已发布的最先进水平,实现了指数级的改进。这标志着人工智能在推理复杂数学问题能力上的重大进步。
作者描述被GPT 5.6和Codex深深打动且不安,强调该模型能够分解任务、回忆错误,并提出了一个优化后的流程及其具体效率提升。
Peter Gostev比较了Fable和GPT-5.6-Sol,认为Fable更聪明、更有口才但可靠性较差,而GPT-5.6-Sol则是一个勤奋的“工作马”,擅长执行任务和保持代码模式。他详细观察了UI、写作、稳健性及其他功能。
Ahmad Osman 预测,在18个月内,像 RTX 5090 这样的GPU将能够承载相当于 GLM 5.2 的智能。
前沿模型在生成网页应用方面已经变得非常熟练,以至于作者现在以从头构建WebGPU水渲染器为基准,比较了Opus-4.8和采用GPT-5.5实现器的Fable-5编排器。
Corey Quinn 为自己低估 OpenAI 的 Codex 而道歉,并称赞其显著的进步和能力。
作者质疑关于 Fable 5 AI 模型所报道的能力是否真实,抑或是心理战的一部分,并指出缺乏证据,以及 AWS 和 NSA 声称的时间点可疑。
Anthropic证明,AI系统现在能够进行世界建模,Fable对峙实验即是证据。
本文探讨了使用本地运行模型是否能够现实地达到与Claude或Codex相当的人工智能能力,并分析了开源替代方案的现状及其局限性。
一位Reddit用户质疑为何有些人无视AI的能力,尽管他们自己有过AI解决复杂问题的正面体验,暗示公众认知与AI实际表现之间存在脱节。
这条推文评论了锯齿状智能的概念,指出在这种模式下,fable 并没有明显更好,而代码是个例外。
Claude Fable 5 是 Anthropic 推出的新型 Mythos 级 AI 模型,据称擅长编码,但在设计能力方面仍有欠缺。
OpenAI 报告称,在当前的人工智能系统中看到了递归自我改进的早期迹象,这可能是人工智能能力的一个重要发展。
用户表示,Claude 在 Google 地图上生成优化旅行路线方面表现出色,能根据步行、驾车或打车等需求个性化定制路线,并发现它非常适合规划东京之旅。
对著名的METR AI时间跨度图的详细批评揭示了大量严重的方法论错误,包括有偏差的人类基线、未测量的数据以及测试-训练数据污染,削弱了其关于AI能力的结论。