@IntuitMachine: 以下是针对 Satya Nadell 的 Reverse Information Paradox 的本地 LLM 解决方案。你的 AI 代理失败的原因与此相同…

X AI KOLs Timeline 新闻

摘要

TRACE 是一种方法,通过对比诊断识别 AI 代理缺失的少数能力,然后在合成微环境上训练微小的 LoRA 适配器,在编码基准测试上实现 15 分以上的提升,同时计算量大幅减少。

以下是针对 Satya Nadell 的 Reverse Information Paradox 的本地 LLM 解决方案。 你的 AI 代理失败的原因,和你在健身房练不出效果的原因一样——你什么都练,但其实你只差 4 项。 一个 27B 模型通过训练 4 个小适配器而非整个大脑,就在代码能力上击败了 GPT-4。 数据简直惊人: 你错在哪: → 运行 10,000 个训练样本 → 其中 75% 的技能模型早已掌握 → 你真正缺失的 4 项能力?淹没在噪声中。 就像你不会深蹲却拼命练二头肌弯举。 TRACE 找到了你真正需要的 4 项练习。 突破点:对比诊断(CONTRASTIVE DIAGNOSIS) 对比你代理的成功与失败。 找出那些只在失败中出现的能力。 结果?80% 的错误可追溯至 4 项能力。 不是 100 项,不是 50 项。 就是 4 项。 在 SWE-bench(最难的编码基准)上的结果: 旧方法:训练一切 → +3 分 TRACE:训练 4 项技能 → +15.3 分 成本:仅需 1/4 的计算量 时间:8 天而非数月 本不该如此。 下面这部分让我脑洞大开: 对于每项缺失的技能,TRACE 自动生成一个合成的微环境(SYNTHETIC MICRO-ENVIRONMENT)。 微小、可验证、无法作弊。 想象一下:一个只测试「错误恢复」或「API 链式调用」的谜题。 然后它针对该谜题训练一个参数占比 5.3% 的 LoRA。 现在你有了 4 个专家适配器: Adapter 1: 文件导航 Adapter 2: 错误恢复 Adapter 3: 多步骤规划 Adapter 4: API 链式调用 如何使用它们?Token 级路由。 每个 token 被发送到正确的专家。无需合并,没有干扰。 这打破了规模定律的神话。 你不需要 GPT-5。 你需要知道 GPT-4 在哪些方面不行,然后训练手术刀式的修复。 “最高 ROI 的训练数据不是更多数据——而是让某个特定失败不可能发生的最小环境。” 为什么有效: 斯坦福/MIT 刚刚在以下场景验证: • 客服代理(+12 分) • 网页导航(+18 分) • 编码代理(+15 分) 每次都是同样的模式:诊断 3-5 个缺口 → 训练微 LoRA → 组合 → 发布。 8 天行动手册: 第 1 天:运行 200 次 rollout,提取失败案例 第 2 天:自动生成 4 个合成任务 第 3-6 天:并行训练 4 个 LoRA 第 7 天:训练 MoE 门控 第 8 天:评估并发布 成本:4-8 块 A100,运行一周 收益:+15 分 这就是未来: 代理能够: → 诊断自身缺口 → 生成自己的课程 → 训练手术刀式修复 → 在循环中自我改进 无需人工标注。 无需猜测。 我们刚刚跨过了代理能够自我调试的门槛。 激进观点: 提示工程已死。 微调整个模型是浪费。 新的范式是能力 LoRA(CAPABILITY LORAS)。 同意?不同意? 在下方留下你的看法——我会在一小时内回复每个人。
查看原文
查看缓存全文

缓存时间: 2026/07/13 15:57

以下是解决萨提亚·纳德拉逆向信息悖论的本地LLM方案。

你的AI代理失败的原因,跟你健身时练不到位的原因一样: 你只是在乱练所有项目,而真正薄弱点只有4个。

一个27B模型通过在4个小适配器上训练(而非动整个模型),就在代码能力上击败了GPT-4。

数学逻辑简直离谱:

来看看你错在哪里:

→ 跑10,000个训练样本 → 75%的训练内容模型早已掌握 → 真正缺失的4项能力?被淹没在噪声中。

这就好比你在做二头肌弯举,却连深蹲都做不了。

TRACE找到了你真正需要的4项训练。

突破点:对比诊断法 对比代理的成功与失败案例。 找出只在失败中出现的能力。 结果呢?80%的错误根源指向4项能力。

不是100项,不是50项。

就4项。

SWE-bench(最难的编码基准测试)结果:

旧方法:训练所有内容 → 提升+3分 TRACE:训练4项能力 → 提升+15.3分 成本:仅需1/4算力 时间:8天替代数月

这本来是不可能的。

下面这部分让我震惊:

针对每项缺失能力,TRACE自动生成一个合成微环境。

微型、可验证、无法作弊。

想象一下:一个只测试“错误恢复“或“API链式调用“的谜题。

然后仅针对该谜题训练一个5.3%的LoRA。

现在你拥有4个专家级适配器:

适配器1:文件导航 适配器2:错误恢复 适配器3:多步规划 适配器4:API链式调用

如何使用它们? Token级路由。

每个Token被发送到对应的专家。无需合并、无干扰。

这打破了规模定律的迷思。

你不需要GPT-5。

你需要知道GPT-4在哪方面弱,然后进行手术刀式的修复。

“ROI最高的训练数据不是更多数据——而是那个让某一特定失败根本不可能发生的最小环境。”

为什么有效:

斯坦福/MIT刚刚验证了,在以下场景:

• 客服代理(+12分) • 网页导航(+18分) • 编码代理(+15分)

每次模式相同:诊断3-5个缺口 → 训练微LoRA → 组合 → 上线。

8天行动手册:

第1天:运行200次运行,提取失败案例 第2天:自动生成4个合成任务 第3-6天:训练4个LoRA(并行) 第7天:训练MoE门控 第8天:评估+上线

成本:一周4-8块A100

收益:+15分

这就是未来:

能够做到以下操作的代理: → 自我诊断缺口 → 自生课程 → 训练手术刀式修复 → 闭环自我改进

无需人工标注。 无需猜测。 我们刚刚越过了代理能自我调试的门槛。

激进的看法:

提示工程已死。 微调全模型是浪费。 新的趋势是能力LoRA。

同意?反对?

请在下方留下你的看法——接下来一小时内我会回复每个人。

相似文章