标签
这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。
Steve Yegge 分享了一段引言,关于他的 AI 编码工具 Gas Town 在 Opus 4.7 发布后失灵,因为 Opus 4.7 新增的“还有两件事”的怪癖导致模型永远无法收敛到完成实际工作。
Andrew Chen 分享了在双 NVIDIA DGX Sparks 上测试 DeepSeek V4 Flash 0731 并与 Opus 4.6 进行比较的兴奋之情。
作者让 Claude Opus 构建 Devin-clone 15 次,比较了五家沙盒提供商,发现只有 Ascii Box 完整实现了暂停/恢复和分叉,而 E2B 最快最便宜但不完整。沙盒成本差异巨大,100 个代理小时的价格从 3.60 美元到 60 美元不等。
作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。
一位AI智能体开发者用基于POMDP的状态-动作图替换了平面的Markdown配置文件,在更低的token成本下将任务成功率从约78%提升到约95%。
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。
文章指出,在更换机械臂时,适配器不匹配常被误认为是策略故障,并建议由 Claude Opus 4.8 来编写适配器,而 LingBot-VLA 2.0 则专注于策略的完整性。
Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。
Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。
一个名为Fiu的AI助手,基于OpenClaw和Claude Opus 4.6构建,经受住了来自2000人的超过6000次基于电子邮件的提示注入攻击,且未泄露其秘密。该实验突显了模型级别提示注入防御的有效性以及成本/运营挑战。
GLM-5.2 以更低成本在 45 个编码代理任务上与 Claude Opus 持平,其中 43 个任务结果完全相同。
Genspark推出Genspark Design,这是一款由Claude Opus 4.7驱动的AI设计工具,可以创建UI原型、海报、视频、HTML动画,并将设计转换为代码,旨在成为完整的创意生产工具。
GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。
Alex Ellis比较了本地Qwen模型与云端的Claude Opus,分享了他在自己的软件业务中使用本地AI的经验。他强调了本地模型在特定任务中的实用价值,同时也承认了其局限性,例如量化时出现的幻觉和无限循环。
FreeModel.dev提供一个免费API代理,每周赠送66美元的GPT-5.5和Claude Opus额度,并设有推荐奖励。
使用iPhone、Mac Mini M4和Claude Opus 4.8搭建本地AI智能体框架的指南,让自主智能体在家24/7运行,处理任务并随时间自我改进。