标签
BAP-SQL presents a budget-aware observation planning approach for agentic text-to-SQL, treating SQL query choice as a budget-control decision to improve tight-budget success while reducing token usage.
WorldClaw是一个智能体式由粗到细的框架,能够根据文本提示生成大规模、可探索的3D开放世界,利用规划智能体和地形条件组合来产生连贯的全局结构以及可编辑的实例级资产。
介绍了ToolArtist,一个基于统一多模态模型构建的完全智能体图像生成模型,利用SFT和强化学习(RAD-GRPO)动态编排推理、工具使用和图像生成。
Liquid AI 发布了 LFM2.5-2.6B,一款专注于智能体能力的新型小模型。作者很期待测试它在文档摘要等大规模任务中的表现。
一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。
DeepSeek released the official DeepSeek-V4-Flash-0731 weights on Hugging Face, superseding the preview version with enhanced agentic capabilities and competitive benchmark results.
Inkling-Small 是一款总参数 276B、活跃参数 12B 的模型,现已完全开放权重发布。在推理和智能体任务上,其性能与 Inkling 相当,而体积仅为后者的四分之一。
Arcee.ai的Trinity-Mini(26B)由Loka与PrimeIntellect和AWS合作进行后训练,成为用于科学研究的智能工具,支持多步骤工作流和工具协调。
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
llama.cpp现已全面支持适用于所有协议的模型上下文协议(MCP),可在其WebUI中直接实现智能对话和工具集成,无需外部依赖。
AutoDev Studio是一个开源的、与模型无关的多智能体SDLC框架,它编排一系列智能体来自动化软件开发全生命周期,相比Claude Code同类任务可降低7–75%的成本。
Upstage 发布了 Solar Open2 250B,这是一个 2500 亿参数的混合专家模型,仅需 150 亿活跃参数,采用混合注意力机制,支持高效长上下文推理,最高可达 100 万 token,专为代理型用例(如工具调用和多步推理)设计。
Upstage发布了Solar Open 2,这是一个拥有2500亿参数、采用混合注意力机制的开放权重MoE模型,性能与DeepSeek V4 Flash相当,同时在智能体工作流中表现出高效性。
伊隆·马斯克宣布推出Grok Build,这是一项新功能,允许用户像跟人说话一样通过语音转文字与Grok对话来完成各种任务,包括编码任务。
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。