标签
Ornith-1.0是一个专注于agentic编码的开源LLM系列,提供9B到397B MoE的多种大小,可通过Ollama运行,以便与Claude或Pi等工具一起使用。
一位用户报告称,Ornith-1.0-35B 在性能上与 Qwen3.6-35B 相当,但在规划和长任务执行方面更胜一筹,同时开发者宣布开源专门用于代理编码的 Ornith-1.0 系列 LLM。
OpenAI 预览了 GPT-5.6 系列,包括旗舰版 Sol、均衡版 Terra 和经济实惠版 Luna,具备改进的推理能力、智能体能力以及稳健的安全措施。在更广泛发布前,将进行有限预览。
本文介绍了Dockerless,一种无环境的代理化补丁验证器,无需执行代码即可评估补丁,性能超越现有开源验证器,并为编码代理实现高效的后训练。
Ornith开源了Ornith-1.0模型家族,包含9B Dense、31B Dense、35B MoE和397B MoE多个尺寸,在编码任务上取得领先性能,甚至能与GLM5.2媲美。
Ornith-1.0 是一系列专注于智能体编码的开源 LLM,参数范围从 9B 到 397B,在同等规模的开源模型中达到了最先进的性能。
DeepReinforce发布了Ornith-1.0,这是一个MIT许可的开源智能编码LLM系列,包含一个397B MoE模型,该模型在SWE-Bench和Terminal-Bench上超越了Claude Opus 4.7,采用了新颖的自我改进训练策略。
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
Gemini 3.5 Flash 现已原生支持将计算机使用作为内置工具,使开发者能够构建智能体,在浏览器、移动端和桌面环境中进行交互,用于软件测试和知识工作等长期自动化任务。
llama.cpp的Web UI现在支持通过Web Workers在沙箱iframe中执行模型生成的JavaScript,作为可选功能实现轻量级的代理代码执行。
字节跳动的 Seed 2.1 模型在多模态智能体(Claw-Eval)和长视频理解(Video-MME)基准测试中取得了强劲的结果,尽管在感知和智能体能力之间仍存在差距。
Autodata是一种方法,通过元优化使AI智能体能够扮演数据科学家的角色,创建高质量合成训练数据,在计算机科学、法律推理和数学任务等领域实现了性能提升。
一位开发者反思AI智能体如何消除Slack初创公司的利基市场,同时ClaudeDevs透露Claude Code现在为他们产品团队编写了65%的代码,包括Claude Tag工具本身。
Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。
LFM2.5-ColBERT-350M 是一个模型,能从151个工具中可靠地选出最相关的工具,节省令牌并提高准确性,非常适合代理型边缘模型。
一款100%开源的工具,可以将AI编程代理转变为自主视频制作工作室,由@Saboo_Shubham_发布。
这篇博客文章介绍了一种基准测试方法,用于评估开放模型在代理编程任务上的表现,不仅关注准确性,还关注代理过程的效率。它提供了一个使用 pi coding agent 的可定制工具框架,并在不同模型和库版本上进行测试。
一个Qwen3.6-27B的社区微调在SWE-bench上提升了实际Bug修复能力,同时保持了质量,这与导致退化的合成蒸馏不同。