benchmark-results

标签

Cards List
#benchmark-results

人工智能分析:Muse Spark 1.1 结果

Reddit r/singularity · 2026-07-10

人工智能分析报告了 Muse Spark 1.1 AI 模型的基准测试结果,并提供了性能指标。

0 人收藏 0 人点赞
#benchmark-results

ZAYA1-8B 技术报告

arXiv cs.AI · 2026-05-08 缓存

本报告介绍了 ZAYA1-8B,这是一款在 AMD 硬件上训练的混合专家推理模型,使用少于 10 亿的激活参数在数学和编程基准测试中取得了具有竞争力的性能。报告还详细介绍了马尔可夫式 RSA(Markovian RSA),这是一种用于聚合并行推理轨迹的新型测试时计算(test-time compute)方法。

0 人收藏 1 人点赞
#benchmark-results

Claude 3.5 Sonnet 在 SWE-bench Verified 上再创新高

Anthropic Engineering · 2026-05-08 缓存

Anthropic 升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中达到了 49% 的全新最优成绩,展现了在自主软件工程任务方面的显著能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈