@GregKamradt: "代码和数学正在蓬勃发展,因为它们易于验证,下一个前沿是难以验证的领域" Th…

X AI KOLs Timeline 新闻

摘要

Greg Kamradt 提出了一个AI验证难度的7级谱系,范围从像数学和代码这样可即时验证的领域,到具有缓慢、嘈杂反馈的文明规模系统。

"代码和数学正在蓬勃发展,因为它们易于验证,下一个前沿是难以验证的领域" 这让我思考——“易于验证”的光谱是什么样的? 这与 @DarioAmodei 的“智能瓶颈”领域大致吻合。 我对于从易到难的理解: - Level 1: 即时、客观的验证 数学、代码、形式化证明、国际象棋战术、解析 AI 在此最容易改进,因为反馈循环紧密 - Level 2: 快速但不完整的验证 软件工程、UI实现、数据分析、安全漏洞查找 你可以测试很多,但无法测试所有。“通过测试”不等于“做得好” - Level 3: 可人工评估的创意工作 文案写作、设计、视频缩略图、销售邮件、落地页 通过人类或市场可以进行验证,但有噪声。AI可以通过预测人类反应来改进,但品味会变化,指标可能被操纵 没有“正确”答案,只有来自人类的反馈 - Level 4: 市场可验证的工作 创业、投资、产品策略、招聘、定价、分销 现实会给出反馈,但缓慢且充满混杂因素 - Level 5: 实验可验证的科学 材料、生物学、化学、医学、机器人学 存在客观真理(物理),但实验耗费时间和金钱。当AI能提出更好的候选并缩小搜索空间时,它最有帮助 - Level 6: 制度可验证的系统 教育系统(Alpha学校)、法律系统、城市规划、公司管理系统 你可以衡量结果,但反馈周期长,且反事实难以判断 - Level 7: 文明规模的验证 民主变体、替代治理、货币体系、文化规范、地缘政治战略 验证缓慢、充满道德负担、有噪声,且往往无法隔离。你可能永远得不到清晰的答案,只有积累的历史证据
查看原文
查看缓存全文

缓存时间: 2026/05/21 15:47

“代码和数学之所以迅速发展,是因为它们易于验证,下一前沿是那些难以验证的领域”

这让我思考——“易于验证“的光谱究竟长什么样?

这与 @DarioAmodei 提出的“智能瓶颈“领域大致吻合。

我对从易到难的排序是:

第1级:即时、客观的验证 数学、代码、形式化证明、棋类战术、解析

AI 在此提升最容易,因为反馈循环极其紧密

第2级:快速但不完整的验证 软件工程、UI 实现、数据分析、安全漏洞查找

你可以大量测试,但无法覆盖全部。“通过测试“不等于“足够优秀”

第3级:人类可评判的创意工作 文案写作、设计、视频缩略图、销售邮件、落地页

通过人类或市场验证是可行的,但充满噪声。AI 可以通过预测人类反应来改进,但品味会变化,指标也可能被操纵

这里没有“正确答案“,只有来自人类的反馈

第4级:市场可验证的工作 创业、投资、产品策略、招聘、定价、分销

现实会给出反馈,但速度缓慢且混杂大量干扰因素

第5级:实验可验证的科学 材料学、生物学、化学、医学、机器人学

存在客观真理(物理学),但实验需要时间和金钱成本。AI 在提出更优候选方案、缩小搜索空间时帮助最大

第6级:制度可验证的系统 教育体系(如 Alpha 学校)、法律体系、城市规划、企业管理系统

可以衡量结果,但反馈周期漫长,且反事实难以判断

第7级:文明层面的验证 民主变体、替代治理模式、货币体系、文化规范、地缘政治策略

验证过程缓慢、充满道德负荷、噪声极大,且往往无法孤立分析。你可能永远得不到清晰答案,只能积累历史证据

——你怎么为验证一部小说定价?

这些领域真的如此吗??

数学和代码难道很容易验证?至少比写一部小说更容易验证吧?

你又如何标准化和形式化写小说的过程?或者生成一个创业点子?

相似文章

验证前沿:编码智能体奖励并无银弹

Hugging Face Daily Papers

本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。