标签
一位用户赞扬来自Cognition的SWE-2,因其强大的编程能力,将其与Codex进行比较,但指出缺乏计算机使用功能。
Ray Fernando 主持了一场直播测试,整夜运行 Grok 4.6,并讨论该模型是否优秀。
一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。
对最新发布的 Ling 3.0 flash 模型的评测,该模型可从单一文本提示生成3D世界。
用户分享了使用Laguna S2.1模型的经验,发现其因详尽的推理风格在复杂调试中效果显著,但不适合作为通用规划器。它成功修复了Qwen和Claude等其他模型无法解决的错误。
一位用户对通过 API 调用的 GLM-5.2 进行了详细评测,称赞其长上下文连贯性、自适应推理能力以及与 GPT-5.5 相当的前沿文本性能,同时指出缺乏原生视觉能力且本地计算需求较高。
用户@TheGeorgePu称赞DeepSeek V4 Pro,称其被低估,并根据初步测试将其与Opus 4.8进行有利比较。