我针对同一Three.js任务测试了10种模型/工具组合
摘要
文章详细介绍了在Three.js科幻机库构建任务中,10种不同AI模型和工具组合的比较,评估了生成时间、令牌使用量和成功率等指标。
暂无内容
查看缓存全文
缓存时间: 2026/09/08 06:36
# 机库模拟测试 / 模型测试
来源:https://alvins82.github.io/hangar-harness-model-tests/
我一直在使用不同的模型和工具链组合测试一个简单的提示词,以找出哪个组合能产生最佳结果。我在`/goal`模式下进行此测试。
**提示词:**构建一个单页Three.js科幻机库,包含悬停无人机、动态警示灯、发光跑道条纹以及微妙的体积雾效平面。需包含无人机阵型切换和电影级摄像机路径。输出一个包含内联JavaScript的独立HTML文件。
| 模型 | 工具链 | 生成时间 | 首字节时间 | 输入Token数 | 输出Token数 | 推理Token数 | 总Token数 | 有效率 | 错误数 | 无人机阵型 | 电影级摄像机 |
|------|--------|----------|------------|-------------|-------------|-------------|-----------|--------|--------|------------|--------------|
| GLM 5.3 Flash Max | CodexOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-codex-glm53flash-max/sci-fi-hangar.html)) | 9分0.232秒 | 9.344秒 | 457,685 | 17,458 | 7,694 | 475,143 | 85.26% | 141 | 阻塞 | 无 |
| Luna 5.6 Max | CodexOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-codex-luna56-max/codex-luna-max.html)) | 9分13.098秒 | 6.199秒 | 1,146,755 | 25,512 | 6,879 | 1,172,267 | 92.76% | 322 | 是 | 是 |
| SOL 5.6 Max | CodexOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-codex-sol56-max/codex-sol-max.html)) | 10分48.765秒 | 8.460秒 | 1,069,163 | 28,278 | 7,515 | 1,097,441 | 94.60% | 215 | 否 | 否 |
| Astra 6.0 Max | CodexOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-codex-astra60-max/hangar-codex-astra60-max.html)) | 37分29.705秒 | 3.589秒 | 1,292,366 | 43,129 | 15,271 | 1,335,495 | 94.93% | 205 | 是 | 否 |
| GLM 5.3 Flash Max | OMPOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-omp-glm53-flash/omp-glm57-flash-max.html)) | 30分14.979秒 | 6.596秒 | 1,678,509 | 63,405 | — | 1,741,914 | 78.54% | 570 | 是 | 是 |
| Qwen 3.8 27B x-high | OMPOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-omp-qwen3827b-xhigh/sci-fi-hangar.html)) | 41分25.836秒 | 15.275秒 | 3,407,451 | 71,935 | 49,131 | 3,479,386 | 86.92% | 890 | 是 | 是 |
| GLM 5.3 Flash Max | OpenCodeOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-opencode-glm5.7flash/opencode-glm57-flash-max.html)) | 20分28.948秒 | 6.284秒 | 4,305,447 | 50,468 | 33,414 | 4,355,915 | 96.89% | 670 | 是 | 是 |
| Qwen 3.8 27B x-high | OpenCodeOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-opencode-qwen3827b-xhigh/opencode-qwen38-27b-xhigh.html)) | 8分48.470秒 | 10.182秒 | 665,490 | 41,817 | 28,788 | 707,307 | 95.64% | 130 | 是 | 是 |
| Qwen 3.8 27B x-high | DSH / PTCOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-dsh-ptc-qwen3827b-xhigh/hangar20.html)) | 24分32.929秒 | 7.724秒 | 1,012,499 | 89,894 | — | 1,102,393 | 91.69% | 235 | 是 | 是 |
| Qwen 3.8 27B x-high | DSHOpen ([链接](https://alvins82.github.io/hangar-harness-model-tests/hangar-dsh-qwen3827b-xhigh/deepseekharness-qwen3827b-xhigh.html)) | 18分15.239秒 | 6.755秒 | 2,654,457 | 78,232 | — | 2,732,689 | 95.48% | 422 | 否 | 否 |
所有GLM运行均标记为`GLM 5.3 Flash Max`;输入Token数包含缓存输入。输出Token数为生成总量,包含推理部分;当工具链单独报告推理量时,推理列显示该子集。DSH适配器不单独报告推理Token数。DSH运行时长为两个回合的活跃时间总和,不包括回合间的暂停时间。工具错误记录为失败的工具事件。破折号表示数据不可用或未报告。
相似文章
驾驭之道
作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。
我的AI代理在不同会话间不断丢失自身状态,因此我选择重建工具链而非更换模型
作者发现AI代理的可靠性问题源于工具链而非模型,通过分离上下文跟踪、加载和输出检查来改进,同时致力于版本控制以管理跨项目的代码。
观察:每个模型的最佳代理框架将由模型开发者自身提供
讨论人工智能模型如何在使用其自身开发者构建的框架时表现最佳,而第三方框架可能导致表现不佳,尽管基准测试成绩出色。文中引用了Claude Code(针对Claude模型)和Codex(针对GPT模型)等示例。
我们需要一个工具基准排行榜
本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。
评估框架确实重要
作者强调评估框架对DeepSeek V4.1 Flash AI模型的性能有显著影响,表明在AI测试中框架选择的关键作用。