标签
一位工程师测试了14个AI模型,向它们展示了20个来自2026年的真实AI事件,且无网络访问权限,发现模型对这些事件的平均可能性评分仅为36%,凸显了其自我预测能力的显著差距。
本文提出 SCALE,一种顺序成本感知的假设检验策略,该策略利用 AI 判断并辅以选择性的人工验证,在控制错误率的同时最小化成本,可应用于软件可靠性评估等场景。
本文解析了用于评估 AI 智能体回应的 Jev 与 LLM 作为评判者之间的区别,强调了根据需要开放式推理还是结构化并行判断来选择使用哪种方式。
本研究评估了Jev,一个System One模型,用于测量AI生成的放射学报告中的事实性差异,证明了其相较于其他评估方法的有效性和效率。
Humanity’s Last Exam 的一个更新版本,这是一个用于AI评估的基准,名为 HLE-Diamond,已经宣布并发布。
OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。
本文总结了来自 Hamel Husain 和 Shreya Shankar 的 AI Evals 课程的 8 个核心技能,旨在指导工程师和产品经理构建有效的 AI 评测系统,涵盖错误分析、评测器设计、校准和监控等步骤。
本文介绍了FrontierMath Erdős,这是一个包含68个开放性Erdős问题的基准测试,用于使用Lean证明助手评估数学领域的AI模型,旨在解决当前AI研究演示中的不足。
作者利用自己的git历史记录构建了一个自定义基准测试框架,用于评估本地AI模型在代码任务中的表现。早期测试结果显示,Flash Next和Swift等模型的性能表现令人惊讶。
Glasshouse v0.1 是一款内存基准测试工具,旨在解决现有 AI 内存基准测试的痛点,支持多语言、多种对话长度,并在多个维度上进行细致评估。
CleanScore是一种黑盒方法,用于审计公共基准测试分数,通过比较在原始问题上的表现与独立编写的题目,并使用负控制来区分技能和暴露效应。
本文介绍OpTFM,一个针对医疗保健领域表格基础模型的比较评估框架,从六个临床意义显著的维度(如泛化性和公平性)评估模型,并应用于两个用例以展示上下文依赖的排名。
情境身份测试(SIT)是一个架构无关的框架,旨在评估AI代理的行为是否功能上可归因于特定的发展谱系,以解决大语言模型中的人格模仿问题。
UK AISI 与 EvalEval 正在合作,通过标准化架构和平台公开共享人工智能评估结果,从而提升人工智能模型基准测试的可复现性和透明度。
Spider Bench 基准测试在2,000张蜘蛛照片的数据集上比较了九个视觉模型,其中 Gemini 3.8 Flash 取得了最高的精确物种准确率,为49.85%。该研究提供了公开的代码、任务、预测和结果,以确保可复现性。
Beacon是一个开源的AI编码代理记忆层,使用Jev评估代理运行,并将有用的工作流程、纠正和调试模式转化为跨多个工具的可重用技能。
PolyBridgeBench是一种新的可执行基准测试,用于评估多模态大型语言模型在基于物理的桥梁设计任务中的表现,揭示了结构合成与修复中确定性有效性与动态成功之间的差距。
CogGym 是一个可扩展框架,利用认知实验比较人类与AI认知能力,研究发现规模更大的语言模型能更好地模仿人类推理,但仍落后于形式化基准。