@omarsar0:重要讨论。衡量模型与测试工具的对比完全失效。我更倾向于使用最小化的测试工具如Pi和Hermes Agent来测试模型质量…

X AI KOLs Following 新闻

摘要

作者批评了因偏见和缺乏标准化而导致的AI模型测试工具衡量系统的失效,同时推测像Claude这样的模型可能很快就能动态生成测试工具。

重要讨论。衡量模型与测试工具的对比完全失效。我更喜欢使用最小化的测试工具如Pi和Hermes Agent来测试模型质量。这并不完美,因为测试工具中存在偏见,有利于某些模型而不利于其他模型。 一种标准化的方法缺失但很重要,因为测试工具工程是领先AI公司正在重点投入的领域。这里投入的努力不够,因为事情发展迅速,测试工具优化是个性化的。 另一方面,我认为模型最终将能够根据任务动态生成测试工具。Claude模型已经在一定程度上做到了这一点,尽管相当不一致且仍然是个谜。但这可能意味着测试工具只是一个可调的人工制品,就像系统提示一样。在那个领域,我们如何评估它,具体评估什么?基准测试从这里开始只会变得更加模糊。
查看原文
查看缓存全文

缓存时间: 2026/08/24 01:47

重要讨论。用测试工具衡量模型质量完全行不通。我更倾向于用极简测试工具(如Pi和Hermes Agent)评估模型水准。这并非完美方案,因为现有工具本身存在偏向性,可能更青睐特定模型。

目前缺乏标准化评测方法,但这一点至关重要——头部AI公司正集中精力研发测试工具。然而实际投入仍然不足,行业快速发展导致工具优化各自为政。

另一方面,我认为模型最终将具备根据任务实时动态生成测试工具的能力。Claude系列已初步实现这点,虽然表现不稳定且机制尚不明确。这意味着测试工具可能像系统提示词一样成为可调节的制品。在此背景下,我们该如何评估?具体评估什么?基准测试从此只会愈发模糊不清。

奥努尔·索尔马兹(@onusoz): 我们需要建立标准化测试工具,让模型在统一环境下被测量和评判

“噢但模型X在自家专有工具里表现最好”

我根本不在乎。当我参加考试时,我会去标准化考场,用标准化铅笔,拿标准化试卷——

相似文章

我们需要一个工具基准排行榜

Reddit r/AI_Agents

本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。