标签
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
llama.cpp现已全面支持适用于所有协议的模型上下文协议(MCP),可在其WebUI中直接实现智能对话和工具集成,无需外部依赖。
AutoDev Studio是一个开源的、与模型无关的多智能体SDLC框架,它编排一系列智能体来自动化软件开发全生命周期,相比Claude Code同类任务可降低7–75%的成本。
Upstage 发布了 Solar Open2 250B,这是一个 2500 亿参数的混合专家模型,仅需 150 亿活跃参数,采用混合注意力机制,支持高效长上下文推理,最高可达 100 万 token,专为代理型用例(如工具调用和多步推理)设计。
Upstage发布了Solar Open 2,这是一个拥有2500亿参数、采用混合注意力机制的开放权重MoE模型,性能与DeepSeek V4 Flash相当,同时在智能体工作流中表现出高效性。
伊隆·马斯克宣布推出Grok Build,这是一项新功能,允许用户像跟人说话一样通过语音转文字与Grok对话来完成各种任务,包括编码任务。
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。
Kilo Code for JetBrains 是一款原生开源的编程代理,可与 JetBrains IDE 集成,支持本地和远程开发,并具有并行代理、GitHub PRs 以及访问超过500种模型的功能。
Thinking Machines 发布 Inkling,一种 MoE 模型,总参数975B/活跃41B,支持原生文本、图像和音频推理,上下文窗口达100万 token,完整权重可用。
作者分享了在工作中构建代理系统的经验教训,描述了使用巨型提示、过多工具和动态子代理的失败,最终通过固定编排器和针对每个领域的专业子代理取得成功。
本文介绍了TRACE(Typed Reasoning And Commitment Evidence,类型化推理与承诺证据),这是一种带类型和版本号的模式,用于记录代理系统中的推理轨迹,以实现可审计性并提升推理质量。文中定义了参考写入器、测量机制和消费者契约,并通过两个实例说明了该方法。
本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。
Kimi K3 是 Moonshot 最新的开放权重模型,发布时具备新架构、智能体集群能力,并专注于长期智能体工作流,使其成为其他顶级模型的主要竞争者。
本文指出,LLM中的上下文学习不仅需要内容获取,还需要规范获取,并提出了PSCI(私有规范-契约归纳)方法,该方法提取局部规范并通过对抗性检查强制执行,在CL-Bench基准上取得了最先进的结果。