大语言模型帕累托前沿按基准测试类别划分,Sonnet 5.5 将最后几个 OpenAI 模型挤出前沿边界
摘要
本文讨论了在各项基准测试类别中,AI 模型在帕累托前沿上的排名情况,重点介绍了 Claude Sonnet 5.5 如何改善了 Anthropic 的地位,并在质量、价格和速度方面将部分 OpenAI 模型挤出了前沿边界。
暂无内容
查看缓存全文
缓存时间: 2026/09/28 22:00
# 模型帕累托前沿 —— AI模型按质量、价格与速度排名
来源:https://frontier.warpcore.app/
编程能力,质量与价格对比
## 编程能力·质量与价格对比 · 103个模型 · 10个处于前沿
更多编程能力筛选项 → (https://frontier.warpcore.app/c/coding) 价格越低越好。帕累托前沿模型:Granite 4.2 3B、NVIDIA Nemotron 3 Nano 30B A3B、gpt-oss-20b、Ling-3.0-flash-VL、MiMo-V2.6-Flash、GLM-5.3 Flash、DeepSeek V4.1 Flash、MiMo-V2.6-Pro、Claude Sonnet 5.5、Claude Opus 5.5。
- 最优价值前沿(没有模型既更便宜又更好)
- 证据强度:强 → 弱
- 从其他类别估算
- 估算值(价格或速度)
- 悬停圆点查看详情 · 点击标签高亮显示
来自69家AI实验室的259个模型,涵盖前沿及开源权重模型,基于公开基准测试和独立评估进行评分。评分方法说明 (https://frontier.warpcore.app/methodology)
## 分类
各领域质量前三名,以及价格前沿一览。
- 智能软件工程与代码生成。 1. 1 Claude Opus 5.5 96.9 $8.00 2. 2 Claude Sonnet 5.5 91.7 $4.00 3. 3 Claude Fable 5.1 87.6 $20.0 开放编程能力→ (https://frontier.warpcore.app/c/coding)
- 指令遵循、创意写作与翻译。 1. 1 Claude Fable 5.1 97.6 $20.0 2. 2 Claude Opus 5 93.4 $10.0 3. 3 Claude Opus 5.5 93.0 $8.00 开放写作与对话→ (https://frontier.warpcore.app/c/writing)
- 图像理解、文档与图表处理。 1. 1 GPT-6 Astra 98.9 $20.0 2. 2 Claude Opus 5.5 94.5 $8.00 3. 3 Claude Fable 5.1 87.4 $20.0 开放视觉能力→ (https://frontier.warpcore.app/c/vision)
- 研究生级科学与竞赛数学。 1. 1 Claude Opus 5.5 99.9 $8.00 2. 2 Claude Fable 5.1 95.7 $20.0 3. 3 Claude Sonnet 5.5 95.2 $4.00 开放高难度推理→ (https://frontier.warpcore.app/c/reasoning)
- 工具使用、计算机操作与网络研究。 1. 1 Claude Opus 5.5 99.6 $8.00 2. 2 Claude Fable 5.1 89.6 $20.0 3. 3 Muse Spark 1.3 87.4 $2.00 开放智能体能力→ (https://frontier.warpcore.app/c/agents)
- ### 图像生成 38个模型 文生图、图像编辑与文字渲染。 1. 1 GPT Image 2.5 Sunburst 99.5 $0.21 2. 2 GPT Image 2.5 Flare 91.7 $0.21 3. 3 GPT Image 2 82.6 $0.21 开放图像生成→ (https://frontier.warpcore.app/c/image-gen)
- ### 视频生成 34个模型 文生视频、图生视频与原生音频。 1. 1 Gemini Omni Flash 96.9 $0.10 2. 2 Gemini Omni 1.1 Flash 94.3 $0.10 3. 3 Wan 3.0 93.8 $0.20 开放视频生成→ (https://frontier.warpcore.app/c/video-gen)
- ### 排名如何构建 将各领域基准测试统一为0-100分制,对缺失分数进行估算,并说明每个分数的来源——从实验室报告到独立验证。阅读方法论→ (https://frontier.warpcore.app/methodology)
## 最近新增
基于发布时数据排名,随着第三方结果到来进行更新。
- Anthropic 今日 Claude Sonnet 5.5 \#2 编程能力 混合评分 (https://frontier.warpcore.app/m/claude-sonnet-5-5)
- Anthropic 6天前 Claude Opus 5.5 \#1 编程能力 混合评分 (https://frontier.warpcore.app/m/claude-opus-5-5)
- OpenAI 6天前 GPT-6 Sol \#4 视觉能力 已验证 (https://frontier.warpcore.app/m/gpt-6-sol)
- OpenAI 6天前 GPT-6 Luna \#18 视觉能力 已验证 (https://frontier.warpcore.app/m/gpt-6-luna)
- inclusionAI (蚂蚁集团) 6天前 Ming-Image-0.1-Design \#29 图像生成 已验证·开放 (https://frontier.warpcore.app/m/ming-image-0-1-design)
- 小米 MiMo 7天前 MiMo-V2.6-Pro \#7 编程能力 混合评分·开放 (https://frontier.warpcore.app/m/mimo-v2-6-pro)
- SpaceXAI (xAI) 7天前 Grok 4.7 \#5 智能体能力 已验证 (https://frontier.warpcore.app/m/grok-4-7)
- 小米 MiMo 7天前 MiMo-V2.6-Flash \#17 编程能力 混合评分·开放 (https://frontier.warpcore.app/m/mimo-v2-6-flash)
- StepFun 8天前 Step 5 Preview \#8 写作与对话 混合评分 (https://frontier.warpcore.app/m/step-5)
- 阿里巴巴 Qwen 8天前 Qwen-Image-2.1 \#16 图像生成 已验证·开放 (https://frontier.warpcore.app/m/qwen-image-2-1)
## 排行榜之外
语音、演讲、机器人及其他过去30天内的发布。已追踪,未排名。
所有其他发布→ (https://frontier.warpcore.app/launches)
- Perceptron Mk1.5 Perceptron Inc Perceptron Mk1.5 是一款为控制机器人而构建的具身智能体模型,端到端请求完成速度比其前代快高达4.7倍。机器人技术 9月25日 (https://frontier.warpcore.app/launches/perceptron-mk1-5)
- Gemini 3.8 Live with Live Avatar Google DeepMind Gemini 3.8 Live with Live Avatar 结合了实时视频生成与语音,创造了一个交互式虚拟智能体,具备精准的口型同步、自然的面部表情,并支持97种语言的流畅对话轮替。语音交互 9月24日 (https://frontier.warpcore.app/launches/gemini-3-8-live-with-live-avatar)
- Sarvam Vision 2.1 Sarvam AI Sarvam Vision 2.1 是 Sarvam 的文档智能视觉语言模型,新增了从表单中进行结构化键值提取、多页表格解析以及印度语手写识别功能,幻觉更少且API成本低于首个版本。文档处理 9月24日 (https://frontier.warpcore.app/launches/sarvam-vision-2-1)
- GLiNER2.5-Decide Fastino GLiNER2.5-Decide 是 Fastino 的3.4亿参数开源权重编码器,用于基于模式定义的决策(分类、路由、分诊):给定文本和类型化问题,它返回带有概率和置信度得分的有效答案,并在Apache 2.0许可下于CPU上运行。其他 开放权重 9月24日 (https://frontier.warpcore.app/launches/gliner2-5-decide)
- Light-O1 Light Origins Light-O1 是 Light Origins 的首个通用具身基础模型:它从互联网视频中恢复的3D人体运动中学习人类动作先验,然后将其适应到不同的类人机器人和任务上。一个40亿参数的Light-O1-Preview检查点已在Apache 2.0许可下于Hugging Face发布。机器人技术 开放权重 9月23日 (https://frontier.warpcore.app/launches/light-o1)
- Gemini 3.8 Flash TTS Google DeepMind Gemini 3.8 Flash TTS 是一款用于创意语音生成的文本转语音模型,让创作者能根据自然语言提示构建自定义语音角色,可控制情绪、语速和口音,支持100多种语言。语音合成 9月23日 (https://frontier.warpcore.app/launches/gemini-3-8-flash-tts)
- Qwen-Audio-3.1 阿里巴巴 Qwen Qwen-Audio-3.1 是阿里巴巴的五模型音频产品线:升级了ASR、TTS和实时(全双工语音)模型,并新增了两个模型——用于多说话人转录和音频理解的ASR-Next,以及能一次性生成语音、音效和背景音的TTS-Next。发布时降价高达95%。语音技术 9月23日 (https://frontier.warpcore.app/launches/qwen-audio-3-1)
- Nemotron 3 Diarization NVIDIA Nemotron 3 Diarization 是 NVIDIA 的开源权重说话人日志分析模型,用于识别多说话人音频中“谁何时说话”,支持流式和离线推理,可跟踪多达8位同时说话者。语音技术 开放权重 9月23日 (https://frontier.warpcore.app/launches/nemotron-3-diarization)
- FLUX 3 Action Black Forest Labs FLUX 3 Action 是一个70亿参数的开源权重机器人控制模型,源自 Black Forest Labs 的 FLUX 3 主干网络,能够联合预测未来视频帧和机器人动作,实现实时操作。机器人技术 开放权重 9月22日 (https://frontier.warpcore.app/launches/flux-3-action)
- Realtime-Venus inclusionAI (蚂蚁集团) Realtime-Venus 是 inclusionAI 的全双工语音/视听交互模型,能够在说话时持续感知,并能区分背景话音、打断、修正和重新引导。语音交互 开放权重 9月16日 (https://frontier.warpcore.app/launches/realtime-venus)
相似文章
当前开放模型的效率前沿
概述当前开放AI模型在性能与效率之间的权衡,突出效率前沿上的领先模型。
真正的AI竞赛可能已不再处于前沿
本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。
本地前沿现在比 Sonnet 4.5 更智能
这篇文章强调,能在消费硬件上运行的AI模型正在缩小与前沿模型的差距,表明尖端AI将在几个月内免费应用于个人设备。
OpenAI 在关键基准测试中仍保持领先
本文讨论了OpenAI如何在关键AI基准测试中保持领先地位,强调了其在性能指标上的持续主导地位。
开源模型落后了多少?(17分钟阅读)
LessWrong上的一篇分析,探讨了开源与专有AI模型之间的性能差距。