@chengyongru: 一个 agent 认为 A 有 51%概率发生, 另一个认为有 99%. 但只要它们最后都提交 A, 在 FutureX 的单选题里, 答对都是 1 分, 答错都是 0 分. 仔细读完 FutureX 论文后, 这个例子一直留在我脑子里.…

X AI KOLs Timeline 新闻

摘要

作者评论 FutureX 预测评测框架,指出其只对最终答案评分,无法区分概率校准质量,并探讨 Brier score 与 log loss 等更细粒度的评估方式。

一个 agent 认为 A 有 51%概率发生, 另一个认为有 99%. 但只要它们最后都提交 A, 在 FutureX 的单选题里, 答对都是 1 分, 答错都是 0 分. 仔细读完 FutureX 论文后, 这个例子一直留在我脑子里. FutureX 的设计非常务实. Agent 必须在事件发生前提交预测, 官方等结果出现后再评分. 虽然需要真的等这件事发生, 但是我们都明白一个道理,慢就是快, 它是评测成立的一部分. Rhizome v1 用同一套框架搭配三个不同模型, 分别拿到第 1、第 3 和第 7, 也是一个很值得关注的结果. 但如果把预测过程抽象成贝叶斯更新, agent 最后提交的答案只是整个过程的最后一步. 它先根据已有信息形成 prior, 搜索新证据后更新出 posterior, 最后再把这个概率分布压缩成一个选项、排名或数值. FutureX 主榜目前主要评分最后这个 decision, 中间的 belief update 并没有进入 leaderboard. 这不一定是 FutureX 的缺点, 更像是它当前选择的评测边界. 它能判断哪个系统的最终答案在这套 scoring rule 下得分更高, 但无法区分两个相同答案背后, 哪个概率判断长期更可靠. 所以看到推文里提到"校准过的概率"时, 我会更期待另一类证据. 比如保存每次预测的完整概率, 看那些被判断为 70%会发生的事件, 长期是不是真的约有 70%发生, 再使用 Brier score 或 log loss 评分. 这类指标不只看有没有猜对, 也会惩罚自信地猜错. 从这个角度再看 agent 的搜索和多 agent 协作, 也会有点不一样. 搜索的价值不只是改变 posterior, 更是找到独立、可靠且真正有信息量的新证据. 如果十篇报道都引用同一份新闻稿, 它们并不是十条独立证据. 多个子 agent 如果共享相同的基础模型、搜索结果和 prompt, 它们的错误也可能高度相关. 简单投票有时会提高命中率, 也可能只是把共同偏见累积成更高的置信度. 所以裁决机制真正困难的地方就是如何去识别证据和判断之间的相关性. agent 在这份榜单里确实没有答案可以背, 但没有现成答案和没有分布可以适配, 是两件事. 题目来源、日周模板、领域比例、难度权重和评分规则, 仍然构成了一套 benchmark distribution. 这次 Rhizome v1 搭配三个基座都进入前十, 至少是一个效果不完全依赖单一模型的信号. 不过当前公开成绩来自同一周的 59 个事件. 所以比起下一次还能不能拿第 1, 我更期待看到同一版本跨多个周次的表现, 相同模型和预算下的 baseline, 以及每次获得新证据后的概率变化. FutureX 已经迈出了很大的一步, 那就是在结果发生前记录预测, 事后再按真实结果评分. 那接下来的问题就是是, 当一个 agent 说某件事有 70%概率发生时, 这个 70%到底有多可信, 它是不是因为真正有信息量的证据改变了判断, 以及这种可靠性能不能跨时间和领域保持. 太有趣了
查看原文
查看缓存全文

缓存时间: 2026/08/05 12:24

一个 agent 认为 A 有 51%概率发生, 另一个认为有 99%. 但只要它们最后都提交 A, 在 FutureX 的单选题里, 答对都是 1 分, 答错都是 0 分.

仔细读完 FutureX 论文后, 这个例子一直留在我脑子里.

FutureX 的设计非常务实. Agent 必须在事件发生前提交预测, 官方等结果出现后再评分. 虽然需要真的等这件事发生, 但是我们都明白一个道理,慢就是快, 它是评测成立的一部分.

Rhizome v1 用同一套框架搭配三个不同模型, 分别拿到第 1、第 3 和第 7, 也是一个很值得关注的结果.

但如果把预测过程抽象成贝叶斯更新, agent 最后提交的答案只是整个过程的最后一步.

它先根据已有信息形成 prior, 搜索新证据后更新出 posterior, 最后再把这个概率分布压缩成一个选项、排名或数值. FutureX 主榜目前主要评分最后这个 decision, 中间的 belief update 并没有进入 leaderboard.

这不一定是 FutureX 的缺点, 更像是它当前选择的评测边界. 它能判断哪个系统的最终答案在这套 scoring rule 下得分更高, 但无法区分两个相同答案背后, 哪个概率判断长期更可靠.

所以看到推文里提到“校准过的概率“时, 我会更期待另一类证据. 比如保存每次预测的完整概率, 看那些被判断为 70%会发生的事件, 长期是不是真的约有 70%发生, 再使用 Brier score 或 log loss 评分. 这类指标不只看有没有猜对, 也会惩罚自信地猜错.

从这个角度再看 agent 的搜索和多 agent 协作, 也会有点不一样.

搜索的价值不只是改变 posterior, 更是找到独立、可靠且真正有信息量的新证据. 如果十篇报道都引用同一份新闻稿, 它们并不是十条独立证据. 多个子 agent 如果共享相同的基础模型、搜索结果和 prompt, 它们的错误也可能高度相关.

简单投票有时会提高命中率, 也可能只是把共同偏见累积成更高的置信度. 所以裁决机制真正困难的地方就是如何去识别证据和判断之间的相关性.

agent 在这份榜单里确实没有答案可以背, 但没有现成答案和没有分布可以适配, 是两件事. 题目来源、日周模板、领域比例、难度权重和评分规则, 仍然构成了一套 benchmark distribution.

这次 Rhizome v1 搭配三个基座都进入前十, 至少是一个效果不完全依赖单一模型的信号. 不过当前公开成绩来自同一周的 59 个事件. 所以比起下一次还能不能拿第 1, 我更期待看到同一版本跨多个周次的表现, 相同模型和预算下的 baseline, 以及每次获得新证据后的概率变化.

FutureX 已经迈出了很大的一步, 那就是在结果发生前记录预测, 事后再按真实结果评分.

那接下来的问题就是是, 当一个 agent 说某件事有 70%概率发生时, 这个 70%到底有多可信, 它是不是因为真正有信息量的证据改变了判断, 以及这种可靠性能不能跨时间和领域保持.

太有趣了

Xudong Han (@Xudong07452910): 过去两个月,我们一直在闷声干一件事:教 AI 预测未来。

今天可以摊牌了 🎉

在 FutureX,一个专门考察“预测还没发生的事“的实时榜单上,我们的长程预测 agent 拿下:

🥇 第 1 名(基座 Kimi K3) @Kimi_Moonshot 🥉 第 3 名(基座 DeepSeek V4 Pro)@deepseek_ai 7️⃣ 第 7 名(基座 MiniMax

相似文章

@knoYee_: https://x.com/knoYee_/status/2062780637677752366

X AI KOLs Timeline

作者复盘了使用多Agent协作三个月的经验,总结出五个主要痛点(如Agent间矛盾、忽略边界条件、自我审查失效、合并决策困难、压缩执行后暴露更难问题)和两个心得(只读审查Agent价值高、Agent矛盾暴露需求模糊),强调了人类在AI协作中的核心决策作用。

@Xudong07452910: 一个 Agent 做了 20 步任务,最后只收到一个「成功 / 失败」。 训练时怎么知道,真正救了这次任务的到底是哪一步? 清华、浙大和美团团队这篇 AgentOPSD,研究的就是长时 Agent 的信用分配问题。 GRPO 通常把最终奖…

X AI KOLs Timeline

清华、浙大和美团团队提出AgentOPSD,一种递归自蒸馏的信用分配方法,将稀疏的最终奖励转化为逐步信用信号,提升长时Agent强化学习性能。在ALFWorld等任务上显著优于GRPO基线。

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。