@akshdeeps_001: 新排行榜发布
摘要
推特用户@akshdeeps_001发布了一条推文,宣布了一个与AI或技术基准测试相关的新排行榜。
新排行榜发布 https://t.co/9ahn0KRxrU
查看缓存全文
缓存时间: 2026/09/12 18:56
新排行榜刚刚上线 https://t.co/9ahn0KRxrU
相似文章
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
@rohanpaul_ai: 排行榜链接 https://agentmemoryleaderboard.ai/leaderboard/industry/textual… 硬记忆问题从…开始
Agent Memory Leaderboard 是一个公共基准平台,用于通过标准化测试和排名来评估和比较文本和编码代理的记忆系统。
@KLieret: 你可以自己在 ProgramBench 上进行评估:https://github.com/facebookresearch/ProgramBench/… 我们将开放排行榜…
ProgramBench 是一个新的基准测试,用于测试 AI 智能体从编译后的二进制文件及其文档中重建完整代码库的能力。排行榜即将开放提交。
@ryaneshea: 今天我发布了 AI IQ —— 前沿 AI 模型,按照人类智商量表进行评分。摒弃无尽的排行榜表格,AI IQ 展示了:• 模型在智商正态分布曲线上的位置 • 前沿智商随时间的变化 • 模型在智商和情商方面的对比 • 实践中获取智能的成本。包括 GPT-5.5、Claude Opus 4.7、Gemini 3.1、Grok 4.3、Kimi K2.6、Qwen 3.6、DeepSeek V4、Muse Spark 等。链接在首评中。好奇哪张图表最让你惊讶。
作者推出了“AI IQ”,这是一款新工具,按人类智商量表对前沿 AI 模型进行评分,提供模型性能、智能成本以及情商对比的可视化图表,而非传统的排行榜表格。