标签
阿里巴巴发布了其最大的模型 Qwen3.8-Max,参数规模达 2.4T,在 Terminal-Bench 上的成绩比 Fable 5 高出 2%,开放权重将于下周发布。
Qwen 3.8-Max,一个拥有2.4万亿参数的模型,现已正式可用,开放权重将于下周发布,在编程、工作、研究和长期任务等方面带来全面改进。
DeepSeek 的新 V4 Flash 模型据报道是仅次于 Kimi K3 的第二大开源权重模型,以超过 50 倍更低的成本(每 100 万 tokens 0.09/0.18 美元)提供强劲性能,并具备扎实的代码和推理能力。
DeepSeek 宣布推出 V4 Flash GA,声称其在 DeepSWE 基准测试上与 Sonnet 5 和 Grok 4.5 相当,但该说法尚未得到验证。
亚马逊在一个Claude AI项目上花费了180万美元,该项目超预算860%,凸显了部署AI代理进行编码任务的成本风险。
一位具有编码背景的VP/PM分享了使用Claude Opus和Fable等LLM的实践经验,重点指出了模型在记忆、幻觉和原创性方面的局限,同时强调了人类直觉和领域专业知识不可替代的价值。
Grok 4.5,一个强大的编码模型,现已纳入Cursor新推出的印度专属计划,每月₹649,让开发者仅凭一句话就能利用云端代理构建完整应用。
Annie Sexton 和 Kent Dodds 谈到,Claude Code 虽然实用,但让工程问题解决变得枯燥,Sexton 仍在寻找那份乐趣去了哪里。
月之暗面(Moonshot AI)开放了Kimi K3的模型权重,这是一个3T参数的前沿模型,专注于长周期编程、仓库级上下文和工具使用,支持自托管和微调。
MindLab Research发布了Macaron-V1-Tall,这是一个基于Qwen3.6-35B-A3B构建的Mixture of LoRA模型,配备了四个分别用于对话、代理、编码和GenUI任务的专家模块,上下文长度为262K。
llama.cpp现已全面支持适用于所有协议的模型上下文协议(MCP),可在其WebUI中直接实现智能对话和工具集成,无需外部依赖。
作者认为,由于LLM能够处理易于验证的任务,目前可为编程提供约2倍的生产力提升,但根本性限制使其无法实现10倍改进;进一步的提升将来自围绕现有能力重构工具,而非模型改进。
Laguna S 2.1 是一款 120B 类模型,它通过使用长思考令牌解决了 Julia 中的一个复杂编码问题,给我留下了深刻印象。在一个内存受限的重排任务中,它的表现超过了 Qwen 模型。
Anthropic 发布了 Opus 5,专注于 Token 效率和成本降低,而非重大的能力飞跃,提供接近 Fable 的性能,成本减半。
Anthropic 的 Claude Opus 5 被强调为编程、数据分析与知识工作领域的先进模型,具有前所未有的对提示注入攻击的抵抗力。系统卡显示,结合防御措施可将提示注入成功率降至接近零。
在M5 Pro上使用llama.cpp本地测试了更新后的Gemma 4,使用OpenCode进行编码任务时达到60 tokens/s;后端表现良好,但UI/UX不佳。
作者反思了AI智能体在代码导航、调试和报告撰写方面如何超越自己,并询问他人在多智能体工作流(如MCP、Anvita Flow和Agent Protocol)方面的经验。
一位开发者分享了一个激进观点:在 Antigravity 平台上使用 Google 的 Gemini Flash 模型,在执行小型编码任务时,其速度和简洁性优于 GPT 5.6,尽管 GPT 的智能上限更高。