标签
Laguna M.1 是一个 225B 参数、256k 上下文的模型,专为代理编程设计,现已免费在 Cline 中使用。
面向人工智能时代的职业建议帖,认为有价值的工作涉及模型训练中无法评分的问题,强调时间、人际关系、声誉和发现问题的能力比死记硬背解决问题更重要。
Omar强调了构建用于代理编码的LLM验证器和评判器的日益增长的价值,同时Mira Murati分享说Bridgewater与TinkerAPI合作,微调了一个模型用于财务分析。
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
将MTP推测解码引入采用FP8精度的Ornith 35B编码模型,实现了约18%的推断速度提升,且额外VRAM占用极少。
ZCode现已支持macOS、Windows和Linux系统,集成了AI代理用于规划、编码、审查和部署,深度整合GLM-5.2并提供分层定价方案。
ZCode 是一款针对 GLM-5.2 优化的编程适配工具,提供智能体编码功能,包括长时间运行任务、通过消息应用控制机器人,以及多种定价层级。
美团推出了LongCat-2.0,这是一个1.6万亿参数的混合专家模型,具有100万token的上下文窗口,可通过API用于智能编码、工具使用和复杂工作流。
Nathan Lambert 分享了他访问美团的经历,并强调了他们开放模型开发的思路。美团 LongCat 团队发布了 LongCat-2.0,这是一个 1.6T 参数的 MoE 模型,具有 48B 活跃参数和 1M 上下文长度,专为智能体编程构建,可通过 OpenRouter 使用。
美团发布了LongCat-2.0,一个1.6万亿参数的MoE模型,支持100万上下文,声称是首个在五万GPU中国集群上训练的模型,现已在OpenRouter上用于智能编码。
Meituan 推出 LongCat-2.0,一个拥有 1.6万亿参数的 MoE 模型,约480亿活跃参数,支持100万上下文。该模型采用了 LongCat Sparse Attention 和 Zero-Compute Experts 等新颖架构,在编码和推理任务的基准测试中取得了优异成绩。
Cognition推出Devin Fusion,这是一款自适应模型路由器,可在保持真正前沿智能用于代理编程任务的同时,将成本降低35%。
Ornith-1.0 是一系列用于智能体编程的开源自我改进模型,通过联合优化脚手架和解决方案展开的强化学习,在编程基准测试中实现了最先进的性能。
DeepReinforce 发布了 Ornith-1.0,这是一个基于 Gemma 4 和 Qwen 3.5 构建的开源权重、MIT 许可的大语言模型家族,在同类开源模型中取得了最先进的编码性能。
该推文描述了使用LLM维基进行智能编码,称其极其强大,并举例通过吸收多个代码库来开发一个编码工具。
Deep Reinforce发布了Ornith-1.0系列开源自我改进大语言模型,专为智能代理编码设计,参数规模从9B到397B,在SWE-Bench Verified和Terminal-Bench 2.1等基准测试中取得了最先进的性能,超越了Claude Opus 4.7及其他领先的开源模型。
Ornith-1.0是来自deepreinforce-ai的新一代开源代理式编码模型系列,采用强化学习训练,同时优化解决方案和脚手架。其35B MoE版本在编码基准测试中达到了最先进水平,并支持高效的单一GPU部署。
该推文描述了一项测试,其中Ornith-1.0成功识破了一个关于使用Redis的错误前提,突显了其在自主编程中的诚实性。附带的Hugging Face页面宣布了Ornith-1.0,这是一系列开源编码智能体模型,具有最先进的基准测试成绩。
Ornith-1.0-9B是一款新的90亿参数AI模型,针对8-12GB GPU进行了优化,在智能体编码基准测试中表现出色,性能与大小为其2-3倍的模型相当甚至超越。
一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。