@GregKamradt: "代码和数学正在蓬勃发展,因为它们易于验证,下一个前沿是难以验证的领域" Th…
摘要
Greg Kamradt 提出了一个AI验证难度的7级谱系,范围从像数学和代码这样可即时验证的领域,到具有缓慢、嘈杂反馈的文明规模系统。
查看缓存全文
缓存时间: 2026/05/21 15:47
“代码和数学之所以迅速发展,是因为它们易于验证,下一前沿是那些难以验证的领域”
这让我思考——“易于验证“的光谱究竟长什么样?
这与 @DarioAmodei 提出的“智能瓶颈“领域大致吻合。
我对从易到难的排序是:
第1级:即时、客观的验证 数学、代码、形式化证明、棋类战术、解析
AI 在此提升最容易,因为反馈循环极其紧密
第2级:快速但不完整的验证 软件工程、UI 实现、数据分析、安全漏洞查找
你可以大量测试,但无法覆盖全部。“通过测试“不等于“足够优秀”
第3级:人类可评判的创意工作 文案写作、设计、视频缩略图、销售邮件、落地页
通过人类或市场验证是可行的,但充满噪声。AI 可以通过预测人类反应来改进,但品味会变化,指标也可能被操纵
这里没有“正确答案“,只有来自人类的反馈
第4级:市场可验证的工作 创业、投资、产品策略、招聘、定价、分销
现实会给出反馈,但速度缓慢且混杂大量干扰因素
第5级:实验可验证的科学 材料学、生物学、化学、医学、机器人学
存在客观真理(物理学),但实验需要时间和金钱成本。AI 在提出更优候选方案、缩小搜索空间时帮助最大
第6级:制度可验证的系统 教育体系(如 Alpha 学校)、法律体系、城市规划、企业管理系统
可以衡量结果,但反馈周期漫长,且反事实难以判断
第7级:文明层面的验证 民主变体、替代治理模式、货币体系、文化规范、地缘政治策略
验证过程缓慢、充满道德负荷、噪声极大,且往往无法孤立分析。你可能永远得不到清晰答案,只能积累历史证据
——你怎么为验证一部小说定价?
这些领域真的如此吗??
数学和代码难道很容易验证?至少比写一部小说更容易验证吧?
你又如何标准化和形式化写小说的过程?或者生成一个创业点子?
相似文章
@GergelyOrosz:有一种流行理论认为,人工智能最终将使形式化验证成为主流,因为数学证明的正确性…
一档邀请 Hillel Wayne 的播客节目讨论了 AI 是否会推动形式化验证的主流采用,重点介绍了 TLA+ 在亚马逊的使用以及编写形式化规范的挑战。
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。
@VitalikButerin: 许多人声称,在AI辅助的漏洞查找下,安全的代码(因而任何无需信任的东西)将是不可能的…
Vitalik Buterin分享了一个乐观的看法,认为AI辅助的形式化验证是实现安全、无需信任的代码的途径,并链接到他的博客文章,该文章解释了使用Lean进行形式化验证的基础知识。
@rohanpaul_ai: “我确实看到越来越多大规模生产的数学。” ~ 陶哲轩 AI 让这变得可扩展。将证明写作转…
陶哲轩评论 AI 使得大规模生产数学成为可能,将证明写作转化为可搜索的问题:从目标生成数千个迷你引理,然后用廉价检查器过滤掉大部分,只保留少数有效的。
@dabit3:如果你还没有关注@imjaredz,现在就该关注了
本文介绍了Demonstrandum,一个验证优先的多智能体AI数学流水线,能够生成机械可验证的制品,包括通过Lean 4内核验证的反例和猜想证明。