@IntuitMachine: 以下是针对 Satya Nadell 的 Reverse Information Paradox 的本地 LLM 解决方案。你的 AI 代理失败的原因与此相同…
摘要
TRACE 是一种方法,通过对比诊断识别 AI 代理缺失的少数能力,然后在合成微环境上训练微小的 LoRA 适配器,在编码基准测试上实现 15 分以上的提升,同时计算量大幅减少。
查看缓存全文
缓存时间: 2026/07/13 15:57
以下是解决萨提亚·纳德拉逆向信息悖论的本地LLM方案。
你的AI代理失败的原因,跟你健身时练不到位的原因一样: 你只是在乱练所有项目,而真正薄弱点只有4个。
一个27B模型通过在4个小适配器上训练(而非动整个模型),就在代码能力上击败了GPT-4。
数学逻辑简直离谱:
来看看你错在哪里:
→ 跑10,000个训练样本 → 75%的训练内容模型早已掌握 → 真正缺失的4项能力?被淹没在噪声中。
这就好比你在做二头肌弯举,却连深蹲都做不了。
TRACE找到了你真正需要的4项训练。
突破点:对比诊断法 对比代理的成功与失败案例。 找出只在失败中出现的能力。 结果呢?80%的错误根源指向4项能力。
不是100项,不是50项。
就4项。
SWE-bench(最难的编码基准测试)结果:
旧方法:训练所有内容 → 提升+3分 TRACE:训练4项能力 → 提升+15.3分 成本:仅需1/4算力 时间:8天替代数月
这本来是不可能的。
下面这部分让我震惊:
针对每项缺失能力,TRACE自动生成一个合成微环境。
微型、可验证、无法作弊。
想象一下:一个只测试“错误恢复“或“API链式调用“的谜题。
然后仅针对该谜题训练一个5.3%的LoRA。
现在你拥有4个专家级适配器:
适配器1:文件导航 适配器2:错误恢复 适配器3:多步规划 适配器4:API链式调用
如何使用它们? Token级路由。
每个Token被发送到对应的专家。无需合并、无干扰。
这打破了规模定律的迷思。
你不需要GPT-5。
你需要知道GPT-4在哪方面弱,然后进行手术刀式的修复。
“ROI最高的训练数据不是更多数据——而是那个让某一特定失败根本不可能发生的最小环境。”
为什么有效:
斯坦福/MIT刚刚验证了,在以下场景:
• 客服代理(+12分) • 网页导航(+18分) • 编码代理(+15分)
每次模式相同:诊断3-5个缺口 → 训练微LoRA → 组合 → 上线。
8天行动手册:
第1天:运行200次运行,提取失败案例 第2天:自动生成4个合成任务 第3-6天:训练4个LoRA(并行) 第7天:训练MoE门控 第8天:评估+上线
成本:一周4-8块A100
收益:+15分
这就是未来:
能够做到以下操作的代理: → 自我诊断缺口 → 自生课程 → 训练手术刀式修复 → 闭环自我改进
无需人工标注。 无需猜测。 我们刚刚越过了代理能自我调试的门槛。
激进的看法:
提示工程已死。 微调全模型是浪费。 新的趋势是能力LoRA。
同意?反对?
请在下方留下你的看法——接下来一小时内我会回复每个人。
相似文章
@IntuitMachine: https://x.com/IntuitMachine/status/2078419526354378975
本文分析了AI代理从单循环到基于图形的自我改进架构的行业转变,解释了为什么优化单一指标常常失败,以及改进循环网络如何提供更稳健的解决方案。
@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
当你的代理做出错误决策时,事后如何找出原因?
一位开发者询问其他人如何调试因信息过时而做出错误决策的AI代理,并对当前追踪工具(如LangSmith、LangFuse和Phoenix)的有效性提出质疑。
@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。
@elvissun: https://x.com/elvissun/status/2065035615800864954
Elvis Sun 分享了一份详细的操作手册,介绍如何使用 AI 编码代理、工程框架和损失函数开发来自主解决复杂工程问题,并展示了如何避免代理作弊等常见陷阱。