标签
Laguna s2.1 发布时基准测试令人印象深刻,但存在循环和工具使用问题;最近的更新可能已修复这些问题,用户正在询问其是否现在稳定。
Muse Spark 1.1 提升了其在 Text Arena 的排名,现已接近 Fable 5。
Google 已从 Gemini 3.6 Flash 和 3.5 Flash-Lite 模型开始弃用 temperature、top_p 和 top_k 参数,详情请参阅其开发者指南。
Anthropic更新了Claude语音模式,支持Opus、Sonnet和Haiku模型,并集成了Gmail、Slack、Canva和Notion等应用。多语言支持处于测试阶段。
从7月20日起,Claude Fable 5 将包含在所有 Max 和 Team Premium 套餐中,按50%的限额使用。Pro 和 Team Standard 用户将获得一次性100美元信用额度,并可通过使用额度访问。
本线程介绍了关于是否能在不破坏模型的情况下将新事实添加到大语言模型权重中的研究,结果发现模型会意外地崩溃,这使得压缩KV缓存和上下文学习在持续学习中更具前景。
用户测试Kimi 3后发现其性能大幅超过上一代Kimi 2.7,称其为“吊打”,并提到官网已发布Demo。
一位开发者演示了为GLM语言模型添加视觉能力,展示了重要的多模态扩展。
Google 更新了 Gemma 4 的聊天模板,显著修复了工具调用,减少了惰性,在 Hopper GPU 上启用了 Flash Attention 4,并发布了交互式视觉指南。这些更新现已可在 Hugging Face 上获取。
Google Gemma 正在推出对 Gemma 4 的重大改进,这些改进源于社区的反馈和贡献,详情参见一条推文串。
该推文称赞SAM3.1改进了分割效果,能处理模糊边界,并且尾部覆盖更好,从而得到更准确的长度测量。
Sam Altman 宣布,GPT-5.6 sol 的价格是 fable 的一半,并且在许多任务中 token 效率大约是 fable 的两倍,计划以四分之一的价格交付。
Devin Fusion 已整合 Fable 5,其每任务成本竟低于 Opus 4.8,这是由于在任务分配和推理链方面的效率提升。
Sam Altman 宣布,GPT 5.6 Sol 在推出更好的模型之前,仍将在 ChatGPT 订阅(Go、Plus、Pro)中可用,明确了该模型的可用性。
OpenAI 宣布推出 GPT-5.6,这是健康智能领域的一次重大进步,性能更强,且 GPT-5.6 Luna 的成本比 GPT-5.5 降低 25 倍,使先进模型更容易在全球范围内普及。