ai-benchmarks

标签

Cards List
#ai-benchmarks

还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?

Reddit r/ArtificialInteligence · 2026-05-07

本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。

0 人收藏 0 人点赞
#ai-benchmarks

新年特辑!来自 David Cox、Adji Bousso Dieng、Juan M. Lavista Ferres、Tanmay Gupta、Pengtao Xie 和 Sharon Zhou 对 2026 年的展望

The Batch · 2026-01-02 缓存

Andrew Ng 提出了一个新的“Turing-AGI Test”,旨在让系统在联网环境下执行实际工作任务,以更准确地评估通用人工智能水平。他指出,“AGI”一词目前已被过度炒作,亟需精确定义,以免利益相关方对 AI 的实际能力产生误判。

0 人收藏 0 人点赞
#ai-benchmarks

2026年5月22日 Frontier Red Team 评估LLMs开发漏洞利用的能力

Anthropic Research · 2026-06-17 缓存

Anthropic与研究人员合作,在三个新的漏洞利用开发基准(ExploitBench、ExploitGym、SCONE-bench)上对Claude Mythos Preview进行基准测试,发现其性能优于所有其他模型,并展示了LLM漏洞利用能力的重大飞跃。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈