@0xMovez: 遇见 Kimi K2.6 Agent Swarm 亮点:集群升级 - 每次运行 300 个并行子代理 × 4,000 步(从 100 / … 升级而来)

X AI KOLs Timeline 产品

摘要

Kimi K2.6 引入了一项强大的 Agent Swarm 功能,允许在 4,000 个协调步骤中使用 300 个并行子代理,实现自动研究和文件生成。该系统包含一个由 Opus 4.8 验证的自我改进循环,使其成为相对于前版本的重大升级。

遇见 Kimi K2.6 Agent Swarm 亮点:集群升级 - 每次运行 300 个并行子代理 × 4,000 步(从 K2.5 的 100 / 1,500 升级而来)。输出的是真实文件,而非聊天内容——一次运行可交付 100 多个文件、100,000 词的文献综述或 20,000 行的数据集。
查看原文
查看缓存全文

缓存时间: 2026/06/17 20:02

以下是您需要的简体中文翻译:


遇见 Kimi K2.6 智能体集群亮点:集群,全面升级 - 300 个并行子智能体 × 每次运行 4000 步(相比 K2.5 的 100 / 1500 步大幅提升)。输出的是真实文件,而非聊天内容——一次运行可交付 100+ 个文件、10 万字的文献综述或 2 万行的数据集。


自我改进循环:基于 Kimi K2.6 的 300 智能体集群,经 Opus 4.8 验证

一个免费的开源模型正在运行 300 个并行智能体,跨越 4000 个协调步骤,仅从一个提示词出发,在真实研究任务上的得分高于你花费 5 倍价格购买的模型。

大多数人从未打开过它。

他们打开 Kimi,输入一个问题,得到答案,然后关闭标签页。这是聊天框。它有效。但这大约只发挥了该产品的 10%。

以下是大多数人忽略的部分:

集群不仅运行得快。正确运行它,每次都会留下一些东西——一个可复用的技能、一份更精确的规范、一个阻止下次运行重复今天错误的约束条件。

昨天运行你任务的集群应该比今天运行的更聪明。

Kimi.ai@Kimi_Moonshot·4月23日遇见 Kimi K2.6 智能体集群

亮点: 集群,全面升级 - 300 个并行子智能体 × 每次运行 4000 步(相比 K2.5 的 100 / 1500 步大幅提升)。

输出的是真实文件,而非聊天内容——一次运行可交付 100+ 个文件、10 万字的文献综述或 2 万行的数据集。显示更多1044093.7K610K

这就是那个循环。 Kimi 负责执行和学习。Opus 4.8 驻守在一个关口——验证关口——它唯一的任务是阻止垃圾信息被保存为技能。引擎学习。把关者保持诚实。

有些人选择一个模型并与之绑定。有些人追逐最高的基准线。还有其他人搭建 LangGraph 并花一个周末调试 DAG。

结果通常相同:一个工作流在第 50 次运行时与第 1 次运行时做的完全一样。

但这不是那样。这是关于一个持续累积的集群的完整实战指南。10 个步骤。每个提示词都是复制粘贴。每个数字都经过验证。

第一部分——一次构建循环,永久运行。

01. 编写规范,而非提示词

当大多数人听到“300 个智能体”时,他们会发出一个单行指令——“研究健身应用市场”——并期待卓越。这是最快消耗积分并得到垃圾结果的方式。

一个单行提示词相当于允许集群自行决定一切,而它会做出错误决定。

将集群视为承包商,而非精灵。规范定义了要收集什么、什么算有效、允许哪些来源、确切的输出格式以及冲突时如何处理。以下是大多数人忽略的部分:Kimi 自行决定任务分解。

你不需要像在 CrewAI 中那样构建智能体,不需要像 LangGraph 那样布线图,也不需要像 AutoGen 那样定义结构。你描述目标——集群自建组织架构。

规范是整个循环中杠杆作用最高的单一工件,因为在第 4 步,它将变成你可复用技能的种子。

python# 项目:[名称] 目标:[一句话——可交付成果,而非主题] 范围:[包含什么,明确排除什么] 规则:[验证——什么算作经过验证的行/发现] 来源:[官方帖子、论文、一手资料——不包含聚合器] 输出:[文件类型 / 数量 / 命名 / 格式细节] 冲突时:标记该行,绝不静默解决 停止条件:[何时停止并报告,而非猜测]

02. 在花费一分钱之前阅读分解计划

这是新手跳过的步骤,也是跳过成本最高的步骤。

提交规范后,Kimi 会在执行前向你展示执行计划——包含多少子智能体、每个处理什么、依赖顺序、步骤预算。

阅读它。一个错误分解的 200 个智能体集群会消耗真实金钱和真实时间。检查计划零成本。你需要关注三件事:它是否理解范围、智能体数量对于任务规模是否合理、输出计划是否匹配你的实际需求。

一个值得了解的细节:4000 步是整个集群的协调总预算,而非每个智能体 4000 步。一个 300 个智能体的运行平均每个约 13 步——简短、专业化的子任务。这告诉你你的任务是否匹配这个形状。

python在执行前展示拟议的分解:

  • 多少子智能体,每个处理什么
  • 依赖顺序(什么阻塞什么)
  • 预估步骤预算
  • 质量下降风险最大的位置在哪 暂不执行。等待我的确认。

一个单行提示词是一个愿望。一个规范是一道命令。集群执行命令。

03. 允许浪费——这正是关键

现在你运行它。最多 300 个子智能体并行波次启动。第一波处理完全独立的子任务。

随着结果落地,编排器根据依赖关系启动下一波,直到依赖图全部解析。

每个子智能体在其自身的限定上下文窗口中工作。这是结构上的诀窍:一个处理长任务的单一智能体会填满其窗口,直到被淹没并开始有损摘要,此后的每一步推理都会变得更差。

集群为每个子任务提供了各自的作用域上下文,因此只有结构化输出流回协调器。这就是为什么它不会在会搞垮单个智能体的任务上崩溃。

由于 Kimi 的定价为输入 $0.95/M,输出 $4.00/M——缓存命中时仅 $0.16——你可以负担得起丢弃第一次尝试并重新运行。廉价的体量让你敢于尝试更多。

python从头到尾执行规范。 尽可能并行化计划允许的部分。 每 30 步报告一次进度。 立即标记任何阻塞项——不要静默绕开。 如果子智能体停滞超过 10 分钟,重新分配或报告。 将所有内容合并到规范定义的 OUTPUT 中。

04. 要求真实文件,而非聊天答案

集群的输出不是窗口中的文本。它是可以直接投入工作的结构化交付物——而这是大多数文章忽略的部分。

一次运行可以落地 PDF、电子表格、数据集、幻灯片和可运行的代码,全部来自一次启动,因为 Kimi 原生生成这些格式。

因此,始终以输出主导规范。

“一份全面的报告“允许智能体提前停止。“一份 40 页的 PDF + 包含 2 万行的一个 CSV + 14 张可导出的 PNG 图表“则给了它们一个质量目标。

输出层面的具体性是关键差异。

python输出:[文件类型] / [数量] / [命名] / [格式细节]

强示例:

输出:1 个 .xlsx,每模型一行,+ 200 字简要说明 输出:30 个 HTML 文件,每家店一个,按业务命名 输出:40 页 PDF + 2 万行 CSV + 14 张 PNG 图表

05. 让诚实的模型审视输出并指出问题

这是唯一不是 Kimi 负责的步骤。集群的已知缺陷:除非你明确要求验证,否则它会生成自信但缺乏引用的主张,并且独立的子智能体有时会相互矛盾。“看起来完成“和“是正确的“是两个不同的层面。

Opus 4.8 正是为此关口而构建。Anthropic 报告称,与 4.7 相比,它让自身代码中的缺陷未被发现的可能性大约低 4 倍,并且它是第一个在未加批判地报告有缺陷结果上得分为 0% 的 Claude。

它的唯一任务是否定,而非赞扬。你不是在花费高级令牌来生成内容——你是花钱请它捕捉静默缺陷,以免第 4 步将其永久保存为技能。

只有当有可信的东西在检查工作时,廉价体量才是超能力。保持验证关口。

06. 将整个工作流保存为技能

这是让循环实现自我改进的关键。在你会重复运行的任务执行完毕后,告诉 Kimi 将整个工作流捕获为可复用的技能——输入格式、智能体步骤、输出格式。

第一次运行需要 20 分钟。之后每次运行只需 30 秒。

这就是“自我学习“的诚实版本。模型并没有在你的两次运行之间重新训练其权重。

整个系统在变得更聪明——你的技能库随着每个项目而增长,而未来的每个集群都会自动应用这些技能。

竞争对手无法在一周内复制那个库。它来自你数月真实运行的积累。

python将整个工作流保存为可复用的技能:“[名称]” 捕获:

  • 输入格式(期望的文件/规范形状)
  • 有效的智能体步骤
  • 输出格式和命名约定
  • 规范中的验证规则 下次我运行此技能时,附加新文件并获得相同的形状。

07. 将你自己的文档注入为集群知识

技能捕获流程。文档到技能捕获领域。上传你最好的作品——一份成交的提案、一份精炼的报告、一个演示文稿——Kimi 会将其结构和风格指纹捕获为技能,未来的每个集群都会自动应用。

这是累积的地方:你输入每份 PDF、转录稿或电子表格,都会成为所有 300 个并行智能体可依据的上下文,而非依赖通用训练数据。

你输入得越多,后续每次运行的准确性就越高。报告不再读起来像通用的 AI 输出,而是开始读起来像你自己的作品。

python将此文档捕获为可复用的技能。识别其成功要素:

  • 结构和章节顺序
  • 语气和语域
  • 每节的分析深度
  • 写作节奏和格式决策 将其保存为“[名称]“。然后使用捕获的技能生成一份关于[不同主题]的新文档——匹配质量水准,而非内容。

08. 将验证反馈转化为永久规则

第 5 步捕获一次缺陷。第 8 步确保集群永不再犯。获取 Opus 的修复清单,不要仅仅修补输出——将教训融入项目级约束文件,Kimi 会在每次会话开始时自动读取。

这是循环从自身失败中学习的方式。Opus 在第 1 次运行时标记的偏移,在第 2 次运行时成为硬性规则。

经过几个项目后,你的约束文件变成了自我强制的活文档——而验证关口每次需要捕获的东西越来越少。

python# CONSTRAINTS.md — 自动加载

  • 每个声称的数据必须追溯到一手来源,否则被标记
  • 禁止静默解决冲突——暴露矛盾
  • [从上次运行的 Opus 反馈中提炼的规则]
  • [你永远不想重犯的错误] 范围锁定:不要触及规范 SCOPE 块之外的任何内容。

09. 在新输入上重放技能——观察成本骤降

现在迎来回报。第 2 次运行不再从零开始。它从你在第 6-8 步构建的技能、集群知识和约束文件开始。

相同的工作流,新的文件,设置时间大幅缩短。

这就是“累积“不再只是一个流行词、而是在账单上显现的地方。第一次竞品监测运行需要完整的规范和一次验证通过。

第四次运行只需对着保存的技能输入一个 30 秒的提示词,并且输出更精确,因为它继承了之前所有运行的修复。

python在以下新输入上运行保存的技能“[名称]“。 应用 CONSTRAINTS.md。使用捕获的输出格式。 [附加新文件] 仅报告与技能预期形状的偏差。

20 分钟完成第一次运行。第 50 次运行只需 30 秒。这个差距就是构建循环而非提示词的全部原因。

10. 将循环提升为后台智能体

最后一步:一旦循环稳定且技能支持,你就不再手动启动它。

将 Kimi 指向触发器——一个日程表、新文件落地、竞争对手的定价页面——让它主动运行整个循环,仅交付成果和偏差。

竞品监测是个清晰的例子。

第 1 次运行你手动构建并验证。到它成为后台智能体时,它每周并行检查所有竞争对手,并以零边际时间成本将简报投递到你的收件箱。

循环中唯一留下的就是你提出的问题和基于答案做出的决策。

每周按日程运行技能“[名称]“。 触发器:[日程表 / 新文件 / 被监控的 URL] 每次运行时:执行集群,应用 CONSTRAINTS.md, 验证,然后交付 OUTPUT + 与上次运行的差异。 仅当偏差超过[阈值]时才通知我。

结论:

当封闭实验室还在不断交付一个更聪明的聊天机器人时,一个开源模型已经并行运行了 300 个智能体——并且随着你每一次运行,在系统层面变得越来越聪明。

我们以前见过这种确切的模式。一次开源发布重新定义了封闭前沿原本以为拥有的东西,整个领域在一夜之间重新校准。这种情况在 DeepSeek 身上发生过。

一个基于开源权重模型的自我学习集群具有相同的形状。

那些仍在争论哪个模型“赢了“的建设者们,正在回答一个已经不再重要的问题。

现在的问题不再是哪个模型最聪明。而是你能同时运行多少个模型,谁在检查它们的工作,以及你的设置今天是否比昨天更出色。

大多数人会读到这篇文章,并继续将 Kimi 用作聊天框。少数人会在本周构建这个循环。第一次运行需要 20 分钟。之后的每一次运行都是你拥有的杠杆。

构建它。验证它。提炼它。然后看着它每次运行时变得既更便宜又更优秀。

相似文章

@Av1dlive: https://x.com/Av1dlive/status/2062561213532471707

X AI KOLs Timeline

一份全面指南,介绍如何使用Kimi K2.6构建AI智能体集群。Kimi K2.6是Moonshot AI开发的开源权重、1万亿参数的MoE模型。指南涵盖了集群架构、用于训练稳定性的MuonClip优化器,以及使用Kimi执行、Claude规划的编排模式。

Kimi K2.6

Product Hunt

Kimi K2.6 作为开源模型发布,在长程编码与智能体集群基准测试中达到 SOTA 性能。