标签
OpenAI的下一代主要模型Astra在智能体编码和网络安全方面展现出显著的能力提升,并且根据《准备框架》被视为网络安全领域的“关键”模型,计划实施额外的控制措施。
Databricks 分享了大规模管理 AI 编码成本的成熟技巧,包括转向更高效的开源模型和使用 AI 网关,并称成本降低了 70%。这篇文章涵盖了来自 Databricks、Stripe、Coinbase、Uber 和 Ramp 的策略。
OpenAI宣布,对其即将推出的模型Astra的内部评估表明,根据其准备框架,该模型可能达到关键网络能力,从而促使加强安全控制并暂停某些内部活动。
Kimi Moonshot 的开放权重模型 Kimi K3 现已在 GitHub Copilot 中全面推出,以具有竞争力的价格提供前沿级别的智能体编码能力,并由 Fireworks AI 托管。
来自 Kimi Moonshot 的开放权重模型 Kimi K3 现已在 GitHub Copilot 中全面可用,以高性价比的价格提供前沿级的智能体编码能力。
作者反思了27B以下的小语言模型是否正被Qwen 3.5和Gemma 4等更大模型所掩盖,并询问社区中有哪些适合智能体编码任务的高性能SLM。
Daniel Vaughan 所著《Agentic Coding with OpenAI Codex CLI》一书的宣传推文,这是一本全面指南,介绍如何使用 OpenAI 的 Codex CLI 构建智能体 AI 工作流,涵盖 MCP、钩子、子智能体、CI/CD 与企业部署。
Kimi K3 是一款开源模型,在智能体编码基准测试中领先,具备原生视觉和 100 万 token 的上下文窗口,现在可以通过 Modal 的 Shared Endpoint 在 Codex 中运行。
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
一个个人分析,认为虽然LLM可能并非万能,但公司的真正价值在于代理编码用途,像Anthropic、OpenAI和Deepseek这样的公司从中受益,并注意到Luna最近降价80%。
一位软件工程师对使用本地LLM进行智能编码感到沮丧,指出诸如技术债务、忽略指令和过度生成代码等问题,质疑其有用性。
Verdent已与Kimi_Moonshot合作,针对智能体编码工作流优化Kimi K3,提供超越简单API访问的增强性能。该工具链能够以最低成本实现生产级构建,包括3D产品页面和可玩游戏。
Kimi K3,一个2.8万亿参数的模型,现在通过Verdent与Moonshot的合作,拥有了一个优化的智能代理编码工作流,使开发者能够以最大性能构建复杂的真实世界应用。
作者质疑像Claude Code这样的单体式智能体编码工具的效率,认为一个按阶段路由模型的自定义框架可以在不牺牲质量的情况下降低成本,并向社区询问他们的经验和建议。
针对35B编程模型(KAT-Coder-V2.5-Dev、Qwen3.5、Ornith等)的详细对比评测,通过120次运行显示:KAT-Coder与最佳原版通过率持平,且工具行为更规范;而Ornith因执行机制问题失败。完整方法和结果见链接。
一本关于使用Claude Code进行Agentic Coding的书籍已成为亚马逊畅销书,为开发者提供了构建代理驱动工作流的指南。
OpenAI将GPT-Live的全双工语音控制集成到Codex和ChatGPT桌面应用中,实现免提智能编码与多线程任务执行。
Bad Theory Labs 发布了 BTL-3,一款 27B 参数的开源权重智能编码与工具使用模型,通过自定义量化仅需 8.39GB,性能保留率达 92.2%,在包括 HumanEval 95.12% pass@1 等多个基准测试中表现优异。
Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。
Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。