@ryaneshea: 今天我发布了 AI IQ —— 前沿 AI 模型,按照人类智商量表进行评分。摒弃无尽的排行榜表格,AI IQ 展示了:• 模型在智商正态分布曲线上的位置 • 前沿智商随时间的变化 • 模型在智商和情商方面的对比 • 实践中获取智能的成本。包括 GPT-5.5、Claude Opus 4.7、Gemini 3.1、Grok 4.3、Kimi K2.6、Qwen 3.6、DeepSeek V4、Muse Spark 等。链接在首评中。好奇哪张图表最让你惊讶。
摘要
作者推出了“AI IQ”,这是一款新工具,按人类智商量表对前沿 AI 模型进行评分,提供模型性能、智能成本以及情商对比的可视化图表,而非传统的排行榜表格。
今天我发布了 AI IQ —— 前沿 AI 模型,按照人类智商量表进行评分。摒弃无尽的排行榜表格,AI IQ 展示了:
• 模型在智商正态分布曲线上的位置
• 前沿智商随时间的变化
• 模型在智商和情商方面的对比
• 实践中获取智能的成本
包括 GPT-5.5、Claude Opus 4.7、Gemini 3.1、Grok 4.3、Kimi K2.6、Qwen 3.6、DeepSeek V4、Muse Spark 等。
链接在首评中。好奇哪张图表最让你惊讶。
相似文章
@grx_xce:今天,我们推出 @Intelligence_ai。在6个月内,作为10人团队,我们将 ARR 从500万美元增长到6000万美元,并拥有550万用户……
Intelligence_ai 推出 DesignArena,这是一个通过真实用户请求评估 AI 模型的通用界面,获得了由 Index Ventures 领投的 790 万美元种子轮融资。该团队在六个月内将 ARR 从 500 万美元增长到 6000 万美元。
@Alex_ybuild: 嘿嘿,让我隆重向大家介绍面向人类的基准测试——humanbench https://humanbench.ybuild.ai 快来,…
这条推文介绍了humanbench,一个用于评估AI模型以确定其模型大小和个性特征的基准测试工具。
@JenovaAIAgent:IQ Tester 是一款AI代理,通过30个自适应问题估算你的认知能力,涵盖七大推理领域…
IQ Tester 是一款AI代理,通过30个自适应问题估算认知能力,基于心理测量学框架提供详细评估报告,涵盖多个推理领域。
@LiorOnAI: Fireworks 刚刚推出了 Specialized Intelligence Index。它在医疗保健、法律等领域的实际工作中对模型进行基准测试…
Fireworks 推出了 Specialized Intelligence Index (SII),这是一个基准测试工具,用于评估 AI 模型在医疗保健、法律和网络安全等行业真实世界任务中的表现,专注于实际工作表现而非标准化测试。
AI时代的记分卡
OpenAI 探讨 CFO 如何通过 'Useful Intelligence per Dollar' 来衡量 AI 价值,该指标评估完成的工作与成本,而非仅仅 token 成本或采用率。