ai-benchmarks

标签

Cards List
#ai-benchmarks

一个AI在一项测试中得了1753分,而'人类专家'是1000分。这就是为什么我不完全信任这个数字

Reddit r/ArtificialInteligence · 2天前

文章批评了一个病毒式传播的AI基准测试,该测试声称Grok 4.6得分为1753,而人类专家为1000。文章指出,该测试基于AI输出之间的偏好比较,而非客观正确性,因此外观精美的工作可能会获胜,但未必真正更好。

0 人收藏 0 人点赞
#ai-benchmarks

@BenjaminDEKR: 很多人表现得好像 Grok 4.6 刚刚击败了 Anthropic 和 OpenAI,但实际上并没有。Grok 4.6 的数字显示…

X AI KOLs Timeline · 3天前 缓存

对 Grok 4.6 基准测试结果的评论,认为 xAI 并未击败 Anthropic 或 OpenAI,但仍在中上游区间保持竞争力。

0 人收藏 0 人点赞
#ai-benchmarks

古德哈特定律盯上了每一个你信任的基准

Hacker News Top · 2026-07-31

讨论了古德哈特定律如何削弱对AI基准的信任,因为指标一旦成为目标,就会失去作为评估标准的有效性。

0 人收藏 0 人点赞
#ai-benchmarks

我们用几乎无法预测真实世界性能的基准来评估AI

Reddit r/ArtificialInteligence · 2026-07-21 缓存

METR的一项研究发现,使用AI工具(主要是Cursor Pro与Claude 3.5/3.7 Sonnet)的经验丰富的开源开发者完成真实世界问题所花的时间反而增加了19%,这既违背了他们自身的预期,也与专家预测的24%提速相矛盾。

0 人收藏 0 人点赞
#ai-benchmarks

DeepSeek v4 flash 发布版本似乎已在 API 上激活。开放权重即将到来?

Reddit r/LocalLLaMA · 2026-07-20

DeepSeek v4 flash 发布版本似乎已在 API 上激活,开放权重即将到来,可能在其重量级中超越竞争对手。

0 人收藏 0 人点赞
#ai-benchmarks

KIMI K3 在 arena.ai 上击败 Claude Fable 和 GPT 5.6 sol

Reddit r/LocalLLaMA · 2026-07-16

据报道,KIMI K3 在 arena.ai 基准测试中表现优于 Claude Fable 和 GPT 5.6。

0 人收藏 0 人点赞
#ai-benchmarks

为什么美国开源AI实验室在基准测试上还远不及中国实验室?

Reddit r/LocalLLaMA · 2026-07-14

文章质疑为何美国开源AI实验室未能像中国同行那样取得顶尖的基准测试结果,凸显了两国在开源AI发展方面的明显差距。

0 人收藏 0 人点赞
#ai-benchmarks

@gurtej__gill_: ByteDance的Seed团队刚刚发布了他们的Seed2.0模型卡。对于任何厌倦了观看人工智能模型在抽象数学竞赛中表现出色,却在现实软件工程中屡屡碰壁的人来说,这确实是一篇引人入胜的读物。

X AI KOLs Timeline · 2026-07-12 缓存

字节跳动的Seed团队发布了Seed2.0模型卡,详细描述了一个旨在弥合实验室基准测试与现实世界软件工程之间差距的模型。该卡重点介绍了部署层级、性能比较,并坦诚承认了与前沿模型之间的差距。

0 人收藏 0 人点赞
#ai-benchmarks

AI基准测试的含义是什么?

Reddit r/artificial · 2026-07-11

简单解释AI基准测试、分数含义,以及为何100%不代表AI无法进一步改进。

0 人收藏 0 人点赞
#ai-benchmarks

@OpenAI: 我们审计了SWE-Bench Pro,这是最广泛使用的AI编程基准之一,发现它已无法可靠地衡量前沿…

X AI KOLs · 2026-07-08 缓存

OpenAI审计了SWE-Bench Pro编码基准,发现约30%的任务存在故障,因此撤回了此前将其作为主要编码评估的建议。

0 人收藏 0 人点赞
#ai-benchmarks

本地模型的行星级测试

Reddit r/LocalLLaMA · 2026-07-05

正在进行一项针对本地运行AI模型的行星级测试,很可能是在不同环境中对其性能进行基准测试。

0 人收藏 0 人点赞
#ai-benchmarks

当所有AI都在基准测试上达到100%之后会发生什么

Reddit r/AI_Agents · 2026-07-03

这篇文章推测当所有AI模型在基准测试上都达到100%时会发生什么,质疑它们将如何展示优越性。

0 人收藏 0 人点赞
#ai-benchmarks

Design Arena:Gemini Omni Flash 现以 1404 的 Elo 分数在 Video Arena 总排名第一,领先 Seedance 2.0 Mini 101 分的 Elo 分差。

Reddit r/singularity · 2026-07-02

Gemini Omni Flash 已凭借 1404 的 Elo 分数在 Video Arena 排行榜上位列总排名第一,领先 Seedance 2.0 Mini 101 分。

0 人收藏 0 人点赞
#ai-benchmarks

@Meer_AIIT: 大多数'法律AI'只是总结一个PDF就完事了。Ivo Benchmarks 做的是包装器做不到的事。它提取你的…

X AI KOLs Timeline · 2026-07-01 缓存

Ivo Benchmarks是一款法律AI工具,它超越简单的PDF总结,将整个公司的谈判历史导入合同审查中。它根据过去的处理方式对每个条款进行评分,从而在合同谈判中做出更明智的决策。

0 人收藏 0 人点赞
#ai-benchmarks

GLM-5.2 为开放模型树立更高标杆(14分钟阅读)

TLDR AI · 2026-06-23 缓存

GLM-5.2 是一款新的开源AI模型,为开放模型树立了高标准,但仍在追赶专有前沿模型,并且缺乏一些功能,如视觉功能。

0 人收藏 0 人点赞
#ai-benchmarks

我们是否只在用户准备好时才测试AI

Reddit r/artificial · 2026-06-22

本文质疑当前的AI基准测试是否足以评估AI在实时、后台环境(如语音通话、自动驾驶和智能眼镜)中的表现,因为这些测试假设用户已做好准备。

0 人收藏 0 人点赞
#ai-benchmarks

Humanity's Last Exam 当前基准测试成绩思考?

Reddit r/singularity · 2026-06-15

讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。

0 人收藏 0 人点赞
#ai-benchmarks

阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化

Reddit r/ArtificialInteligence · 2026-05-25 缓存

阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。

0 人收藏 0 人点赞
#ai-benchmarks

谁来决定AI告诉你什么?前Meta新闻主管坎贝尔·布朗有话要说

TechCrunch AI · 2026-05-14 缓存

前Meta新闻主管坎贝尔·布朗创办了Forum AI,旨在评估基础模型在地缘政治、心理健康等高风险话题上的准确性,通过专家主导的基准测试来提升AI的真实性。

0 人收藏 0 人点赞
#ai-benchmarks

@aaron_epstein: 新发布的模型在OCR、视觉和STT任务上击败了sonnet 4.6、gemini 3 flash和gpt 5.4 mini @interfaze_ai

X AI KOLs Following · 2026-05-12

来自interfaze_ai的新AI模型声称在OCR、视觉和语音转文字任务上超越领先模型(sonnet 4.6、gemini 3 flash、gpt 5.4 mini)。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈