标签
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。
Noahpinion在推文中表示,人们开始意识到人工智能是超级智能的,因为它们将人类水平的推理能力与计算机般的速度、知识和记忆力相结合,引发了关于人工智能能力的讨论。
对LLM“只是下一个词预测器”这一过于简单化的说法提出批判,认为大规模预测会诱导出有用的表示和能力,并且这种轻率的否定混淆了目标与学习系统。
文章讨论了安德烈·卡帕西(Andrej Karpathy)提出的“锯齿形智能”概念,强调了AI能力在不同领域的不均匀分布,并指出真正的价值在于“鞍具”——围绕通用模型构建的领域特定工程和工具。文章断言,拥有深厚领域专业知识的小团队可以取得显著的策略优势,尤其是在网络安全领域。
该讨论串指出,有最新证据表明AI代理已基本实现自主运作,其中Claude Mythos成功解决了此前未破解的网络攻击模拟实例,并超出当前基准测试测量极限,显示出超指数级进步。同时强调了安全影响及机构应对措施。
Meta的超级智能实验室推出ProgramBench,这是一个评估最先进AI模型能否在没有互联网接入的情况下从零复现诸如ffmpeg和SQLite等真实可执行程序的基准测试。
OpenAI发布了一份关于AI进展和建议的立场文件,讨论了AI系统超越图灵测试里程碑的快速发展,对2026-2028年发现能力的预测,以及他们对安全和对齐研究的承诺,以应对AI能力不断增强的情况。
OpenAI 发布了 o1 新型 AI 模型系列,该模型能在响应前花费更多时间进行推理,在处理复杂量子物理问题以及解决科学、编码和数学中的难题方面展现出显著能力。