@thsottiaux: 你还相信基准测试吗,还是只听从朋友的建议?是什么促使你尝试新模型?

X AI KOLs Following 新闻

摘要

一条质疑基准测试可信度、询问用户尝试新AI模型动因的推文。

你还相信基准测试吗,还是只听从朋友的建议?是什么促使你尝试新模型?
查看原文

相似文章

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。

基准最大化

Reddit r/ArtificialInteligence

讨论了OpenAI市场份额下滑,而Meta和Google却在增长的问题,质疑高基准分数对普通用户是否重要,并提出AI的真正价值在于作为现有产品生态系统中的一项功能。