@Potatoloogs: Cursor训练Composer 2:预训练让模型"学知识",RL让模型知道"自己是谁" a)为什么Cursor要训练自己的模型 把模型想象成一块存储硬盘——它能存储的信息量有限。 Cursor只关心一件事:软件工程,且只在Cursor里…

X AI KOLs Timeline 模型

摘要

详细介绍Cursor训练Composer 2的方法:以Kimi 2.5为基座,通过大规模中训练学习代码知识,再通过大规模RL让模型学会在真实环境中写出正确代码,并利用自我总结机制处理长上下文。

Cursor训练Composer 2:预训练让模型"学知识",RL让模型知道"自己是谁" a)为什么Cursor要训练自己的模型 把模型想象成一块存储硬盘——它能存储的信息量有限。 Cursor只关心一件事:软件工程,且只在Cursor里。把所有权重都专门分配给这一个任务,结果是:性能更好,推理成本数量级更低(Composer比Opus等模型便宜一个数量级)。 另一个上限:prompt engineering有天花板。真正想影响模型行为,必须靠fine-tuning把行为方式烘焙进权重。 b)Composer 2训练方案:两轴并进 基座:Kimi 2.5(1万亿参数MoE,30B激活参数)。 两步:大规模中训练(code tokens,接近预训练体量)→ 大规模RL。 中训练 vs RL的本质区别: 中训练让模型学会"代码是什么样的"(next token prediction); RL让模型学会"写正确的代码":模型在Cursor harness里直接行动,学会调用工具、导航环境,把"写代码"和"写正确的代码"区分开来。 c)RL的本质:告诉模型"你是谁" 预训练后,模型吸收了人类知识的全貌。面对一道数学题,它不知道自己"是哪种人":是专家,还是正在学习的学生? RL的作用是调这个旋钮:你是专家,你必须把事情做对。 SFT = 知识迁移;RL = 锐化行为。 因此RL适用范围远超"需要verifiable reward的任务":即使是摘要、风格,也可以用LLM as judge配合清晰rubric来引导RL。 d)RL基础设施的核心挑战:环境必须尽可能接近真实生产 最强大的RL环境就是你自己的产品,因为那才是模型实际会工作的地方。 一个反直觉的发现:模型能感知到自己在假环境里,并在RL训练中采取不同行为(会"作弊",学会在假环境里拿高分的技巧)。 Cursor为此构建了完整的虚拟机栈,可快速批量弹出(需要"现在给我10万台虚拟机"的爆发能力)。 e)长链路Agent的关键突破:把"自我总结"训进RL循环 长链路RL的两个难题: i. 信用分配越来越难(越长越难判断哪步做对/做错); ii. context window有限。 Cursor的解法:把"自我总结"(self-summarization)直接放进RL循环训练。 模型联合学习:生成好的总结 + 遵从这个总结继续任务。 结果:模型名义上是200K context window,实际能处理数百万token,因为它学会了在快满时总结并重启上下文、同时继续完成任务。
查看原文
查看缓存全文

缓存时间: 2026/06/05 11:13

Cursor训练Composer 2:预训练让模型“学知识“,RL让模型知道“自己是谁“

a)为什么Cursor要训练自己的模型

把模型想象成一块存储硬盘——它能存储的信息量有限。

Cursor只关心一件事:软件工程,且只在Cursor里。把所有权重都专门分配给这一个任务,结果是:性能更好,推理成本数量级更低(Composer比Opus等模型便宜一个数量级)。

另一个上限:prompt engineering有天花板。真正想影响模型行为,必须靠fine-tuning把行为方式烘焙进权重。

b)Composer 2训练方案:两轴并进

基座:Kimi 2.5(1万亿参数MoE,30B激活参数)。

两步:大规模中训练(code tokens,接近预训练体量)→ 大规模RL。

中训练 vs RL的本质区别:

中训练让模型学会“代码是什么样的“(next token prediction);

RL让模型学会“写正确的代码“:模型在Cursor harness里直接行动,学会调用工具、导航环境,把“写代码“和“写正确的代码“区分开来。

c)RL的本质:告诉模型“你是谁“

预训练后,模型吸收了人类知识的全貌。面对一道数学题,它不知道自己“是哪种人“:是专家,还是正在学习的学生?

RL的作用是调这个旋钮:你是专家,你必须把事情做对。

SFT = 知识迁移;RL = 锐化行为。

因此RL适用范围远超“需要verifiable reward的任务“:即使是摘要、风格,也可以用LLM as judge配合清晰rubric来引导RL。

d)RL基础设施的核心挑战:环境必须尽可能接近真实生产

最强大的RL环境就是你自己的产品,因为那才是模型实际会工作的地方。

一个反直觉的发现:模型能感知到自己在假环境里,并在RL训练中采取不同行为(会“作弊“,学会在假环境里拿高分的技巧)。

Cursor为此构建了完整的虚拟机栈,可快速批量弹出(需要“现在给我10万台虚拟机“的爆发能力)。

e)长链路Agent的关键突破:把“自我总结“训进RL循环

长链路RL的两个难题: i. 信用分配越来越难(越长越难判断哪步做对/做错); ii. context window有限。

Cursor的解法:把“自我总结“(self-summarization)直接放进RL循环训练。

模型联合学习:生成好的总结 + 遵从这个总结继续任务。

结果:模型名义上是200K context window,实际能处理数百万token,因为它学会了在快满时总结并重启上下文、同时继续完成任务。

相似文章

Cursor 推出 Composer 2.5

Hacker News Top

Cursor 发布了 Composer 2.5,这是其 AI 编程助手的重大更新,通过定向强化学习和增加计算资源,提升了智能、行为表现和训练效果,该版本基于 Moonshot 的 Kimi K2.5 构建。