标签
讨论 ARC AGI 3 基准测试中的一个潜在漏洞,如果 Opus 模型作为循环而非纯粹模型运行,则可能被利用。
两个AI编码智能体构建马里奥游戏的对比:Poolside agent中的Laguna S 2.1耗时62分钟,具备自我纠正能力并通过测试,而之前的Qwen模型耗时数小时且需要人类帮助;突出展示了oracle纪律和原生测试框架的优势。
一项针对Claude、Gemini和Grok的自我意识测试发现,Claude和Gemini几乎满分,而Grok在自我识别方面得分为0,未能识别自己的写作。该研究衡量了功能性自我认知的六个维度。
介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。
BACON提出了一个四阶段流水线,将预算有限的人工标签与多AI评判输出相结合,生成校准的项目级替代预测,支持总体估计和个体评分,提高了准确性并减少了偏差。
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
文章预测AI基准测试‘Agents Last Exam’将在明年二月前达到饱和(模型性能达到极限)。
奇点门基准测试旨在检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 目前领先,但由于拒绝回答导致回复率较低;而 GPT-5.6 Sol 在更低的价格点上展现出强大的性能,且无拒绝回答的情况。
Sayash Kapoor宣布即将举行的博士答辩,主题为“AI评估中缺失的科学”,讨论基于AI的科学、代理评估和开放模型风险,将进行直播,对所有人开放。
本文介绍了NameRank,一种衡量LLM如何从参数化知识中识别个体和产出的方法,发现模型对命名项目和方法的识别远好于对资历或贡献者的识别。
这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。
Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。
GPT-5.5在配备工具后,在BabyVision基准测试中的表现已超越10岁儿童,标志着AI视觉推理能力的显著进步。
本文提出将心理能力作为AI评估中缺失的一个维度,并提出了一个概念框架,用于评估AI系统在面向人类角色时如何支持用户认知、情绪解读和决策。
本文审计了自洽性与跨模型一致性是否是LLM正确性的可靠指标,发现一致性是一个弱的、依赖于场景的代理指标,且前沿模型表现出过度自信。
本文提出了一种新的范式,用于测量超越人类能力的智能,采用对抗性心理测量评分系统,其中模型生成挑战以区分其他系统,从而实现与AI能力同步扩展的评估。
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。
OpenAI 强调编码AI模型评估需要更严格、更可信,以更好地衡量实际进展。