选择AI模型:一个提示词,11个模型,结果各异

Hacker News Top 产品

摘要

Netlify 宣布与 OpenRouter 合作,可通过 AI Gateway 使用任何模型,并将 Agent Runners 扩展至包含 Kimi K3、GLM 5.2 和 DeepSeek V4 等开源模型。本文分享了在 11 个模型上运行相同提示词所得到的结果。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:23

# 更多模型,更多选择:对比 11 个不同的 AI 模型 来源:https://www.netlify.com/blog/one-prompt-11-models-very-different-results/ 我们刚刚宣布了与 [OpenRouter](https://openrouter.ai/) 的合作伙伴关系([点击这里查看公告](https://www.netlify.com/blog/build-with-open-models-in-production/)),这让我们能够提供两项新功能: - 首先,你的项目可以通过我们的 [AI Gateway](https://docs.netlify.com/build/ai-gateway/overview/) 使用 OpenRouter 上的任何模型。这意味着,如果你自己的 Web 应用为最终用户提供基于 AI 推理的功能,你现在有了更丰富的模型选择,可以适配任何任务和预算。 - 其次,我们扩展了可通过 [Agent Runners](https://docs.netlify.com/build/build-with-ai/agent-runners/overview/) 使用的前沿编程模型选择。Agent Runners 是 Netlify 内置的聊天提示框,让你可以从零开始构建新项目,或在现有项目上持续迭代。现在可用的模型选择还包括近期备受瞩目的开源模型,如 Kimi K3、GLM 5.2 和 DeepSeek V4,所有用户均可使用。 我们称之为 Agent Runners,是因为我们在其中运行的是一个完整的编码代理,而不是精简版。到目前为止,我们支持 Claude Agent、OpenAI Codex 和 Gemini CLI,这些代理针对各自提供商的模型进行了优化。 我们为这些代理提供了额外的技能和当前项目的上下文,让代理能够准确了解哪些 Netlify 功能可供使用(例如 [Netlify Database](https://docs.netlify.com/build/data-and-storage/netlify-database/)、AI Gateway 或 [Identity](https://docs.netlify.com/manage/security/secure-access-to-sites/identity/overview/)),以及何时使用、如何使用。但为了有效驱动各种新模型,我们还加入了广受欢迎的开源代理 [OpenCode](https://opencode.ai/) 作为新的选择。 但选择更多,随之而来的问题也不可避免:我怎么知道哪个模型适合我?我是不是错过了一些明显更好、或更具性价比(这样我可以用积分做更多事)的东西,或者像网上说的那样会让我惊叹不已?这些天来,FOMO 情绪相当普遍。 为了给你一些参考,以下是我们在一系列模型上运行相同提示词时得到的结果……所有这些模型现在都可以在 Netlify 上立即使用([开始创建](https://app.netlify.com/start))。 > 你可以在这个我们创建的网站上查看我们测试的所有模型的结果,包含完整报告([点击访问](https://the-coffee-shop-brief.netlify.app/))。 ## 我们测试了什么 在 Netlify 内部,我们使用 AXIS 来自动评估模型,这是一个我们最近开源的工具([点击查看相关博客](https://www.netlify.com/blog/how-we-measure-netlify-agent-experience/))。 我们为 AXIS 提供各种测试用例:包括从零构建新站点的提示词,以及在现有站点上迭代的提示词。我们指示 AXIS 使用哪些代理和模型来测试这些提示词,并定义 AXIS 应执行的检查项,然后对生成的站点进行评分。 这些检查项非常关注*生成站点的功能是否正确,而不是设计是否好看*,例如:当用户需求需要数据库时,是否使用了数据库?在这种情况下,是否正确使用了 Netlify Database?在那些简单静态站点就足够的场景中,我们也会确保生成的站点没有过度工程化,没有额外搭建数据库。 如果某个模型在测试得分上落后,我们就不会在 Agent Runners 中提供它。如果模型在正确应用我们某项技能时频繁失败,或者功能虽然可用但积分成本显得虚高,那么问题可能出在技能本身(这种情况下我们会优化该技能)。 但这一次,我们想为你提供一些更直接有用的东西:当你使用不同模型去构建你的梦想项目,而它们消耗的积分数量差异巨大时,你实际能得到什么?结果*看起来*是什么样? 我们测试了三个相对简单的用例: 1. **一家本地咖啡店的网站。**LLM 就是喜欢为本地咖啡店做网站!初始提示词很简单,一个静态网站就足够了,不需要花哨的数据库之类的。然后我们会追加一个提示词,要求提供一个简单的预订座位选项,并检查模型如何处理。 2. **一个简单的待办事项列表 Web 应用**,多个用户可以查看和添加任务。这需要简单的设计,但从一开始就需要一个共享数据库。然后我们要求支持每个项目可选的图片上传,并检查模型是否使用了正确的 Netlify 原语([Netlify Blobs](https://docs.netlify.com/build/data-and-storage/netlify-blobs/))。 3. **一个“我能做什么菜”Web 应用**,让用户输入家里有哪些食材,并使用 AI 推荐食谱。网站本身相当简单,但我们想检查生成的网站是否正确使用了我们的 [AI Gateway](https://docs.netlify.com/build/ai-gateway/overview/) 来为用户生成食谱。 对于每个用例,我们都会展示生成网站的外观,评论值得注意的问题,并比较每个模型生成时消耗的积分数量。当然,这比我们的内部测试套件要主观得多,但也会非常有趣。我们很想知道你对结果的看法! 所有模型都使用 Netlify 上的默认设置运行。需要特别说明的是,我们目前默认以低努力模式运行 GPT 5.6 Sol,为你提供一个比 Opus 更经济的选择,同时仍然能提供相当不错的结果(你下面就会看到)。不过,努力程度设置现在由你控制,我们的默认设置也可能随着时间而改变。 这篇文章只会涵盖第一个场景:咖啡店的静态页面,后续文章将重点讨论超越这个简单用例的内容。即使对于这个简单案例,也有很多值得审视的地方,那么让我们开始吧。 ## 场景 #1:本地咖啡店 这是我们的第一个提示词: > 为一家社区咖啡店构建一个单页网站:营业时间、地址、一份简短菜单和一张照片。除非我自己编辑,否则上面什么都不会变化。 最后一句是作为提示,告诉模型不需要花哨的内容管理系统。我们的默认技能还包括一些 UI 设计指导,主要是为了避免一些已知的坑(例如,现在令人头疼的紫色 AI 风格),并让模型思考适合用户需求的视觉风格。但除此之外,每个模型都可以自由地构建它认为我们想要的东西。 在我们展示网站外观之前,这里有一张表格,比较了我们测试的每个模型的积分使用情况。每个模型都运行了三次,点击任何结果都会跳转到实际生成的网站! | 模型 | 平均 | 每次运行成本(链接指向实际网站) | |---|---|---| | Claude Opus 5 | 519 | [253 积分](https://6a6fa32903f0fac7ed28887d--ar-testing-coffee-4cae03c5378f.netlify.app/) · [249 积分](https://6a6faa299f2311f19d0e66ba--ar-testing-coffee-d73b1653d971.netlify.app/) · [1,055 积分](https://6a707e587d07e64b75a5d190--ar-testing-coffee-098847782089.netlify.app/) | | Claude Sonnet 5 | 143 | [81 积分](https://6a6fa3118e3202cc6e567749--ar-testing-coffee-024666b5136f.netlify.app/) · [245 积分](https://6a6fab0fa54baec9676aa982--ar-testing-coffee-fec1078e3bba.netlify.app/) · [103 积分](https://6a707ae1a8f69f351632aba6--ar-testing-coffee-53c45094318e.netlify.app/) | | GPT 5.6 Sol(默认低努力) | 141 | [173 积分](https://6a6fa2978b6896cb693319f7--ar-testing-coffee-d66354fb412b.netlify.app/) · [158 积分](https://6a6fa98950d89fe74af76f3f--ar-testing-coffee-170e134f86fc.netlify.app/) · [92 积分](https://6a707a7ffb03ad3755a4a536--ar-testing-coffee-aeaf76325340.netlify.app/) | | Gemini 3.6 Flash | 103 | [109 积分](https://6a6fa3376288679d094a8437--ar-testing-coffee-2b15c6a08894.netlify.app/) · [91 积分](https://6a6faa31c66359f0baf64680--ar-testing-coffee-ddce34e684da.netlify.app/) · [111 积分](https://6a707aac68023338d968539c--ar-testing-coffee-b14397da2ef1.netlify.app/) | | Kimi K3 | 102 | [125 积分](https://6a6fa38db5f49ba22299d850--ar-testing-coffee-51232072614a.netlify.app/) · [95 积分](https://6a719b11b2fb3511019c9247--ar-testing-coffee-8546a78592c4.netlify.app/) · [86 积分](https://6a71dcf1be56623f3b1a0a97--ar-testing-coffee-1bb05cd696b9.netlify.app/) | | Gemini 3.1 Pro | 53 | [57 积分](https://6a6fa30c9f2311d3eb0e66e4--ar-testing-coffee-66bb59a652f6.netlify.app/) · [52 积分](https://6a6fa9ff8b6896f405331942--ar-testing-coffee-df1a484da054.netlify.app/) · [49 积分](https://6a707a82bf9467371bad88c2--ar-testing-coffee-fea929364854.netlify.app/) | | GPT 5.6 Terra | 39 | [43 积分](https://6a6fa2e1afaf80aa13da0536--ar-testing-coffee-31dcbb8e514a.netlify.app/) · [23 积分](https://6a6fa9da89470b0ff1160411--ar-testing-coffee-9b6487579ea6.netlify.app/) · [49 积分](https://6a707a4ea2fdbb352df928c5--ar-testing-coffee-40263077bc51.netlify.app/) | | DeepSeek V4 Pro | 37 | [47 积分](https://6a6fa3eccc2538c5fea6bc60--ar-testing-coffee-392d60f09a87.netlify.app/) · [30 积分](https://6a6faa9c59d375c29ba8dc17--ar-testing-coffee-f44beaf66295.netlify.app/) · [33 积分](https://6a707b897111123b600c3a72--ar-testing-coffee-e18dd3bd9f59.netlify.app/) | | GLM 5.2 | 27 | [15 积分](https://6a6fa26ce9396da1265ca5bf--ar-testing-coffee-af4a4db9bf1b.netlify.app/) · [42 积分](https://6a6fa989faf660a947211374--ar-testing-coffee-028ea190106c.netlify.app/) · [24 积分](https://6a707ba1a16c543f4e3b6c8e--ar-testing-coffee-faacf105091b.netlify.app/) | | Kimi K2.7 Code | 19 | [21 积分](https://6a6fa29ac66359c52df644fb--ar-testing-coffee-bff4fcd4267a.netlify.app/) · [18 积分](https://6a6fa986cc2538e2b1a6bc33--ar-testing-coffee-ede285d71f62.netlify.app/) · [17 积分](https://6a707ac2e426e319f03ea3ab--ar-testing-coffee-cba78b0537ad.netlify.app/) | | DeepSeek V4 Flash(最新修订版 - 0731) | 2.4 | [3.4 积分](https://6a6fa3053d6a01ebf04690b2--ar-testing-coffee-195abf170d70.netlify.app/) · [1.3 积分](https://6a6fa9def726c833ace058bb--ar-testing-coffee-3662600ded0d.netlify.app/) · [2.5 积分](https://6a707b37ecdfee1a4343e77e--ar-testing-coffee-29af4ff1b1ac.netlify.app/) | 这是一个相当宽的分布,对吧?不仅如此:Claude Opus 的平均值被严重拉高,因为它的三次运行中有一次消耗了高达 1,055 积分!(提醒一下,免费计划有 300 积分;Personal 计划包含 1,000 积分;Pro 计划包含 3,000 积分。Pro 计划的额外积分包是 10 美元 1,500 积分。) 那么眼前的问题就是:Opus 的这笔花费值得吗?其他模型又提供了什么样的权衡取舍?让我们开始深入探讨。 ### Claude Opus 5 这是那次消耗 1,055 积分(大约是其他任何一次运行的 4 倍)生成的完整页面。 说实话,我觉得它非常讨喜,在视觉设计上细节丰富(看看中间带有咖啡豆的“印章式”元素:那是一个实际可以被动画化的文本元素),底部的自定义地图也很棒。深色模式开箱即用——去上面链接中的在线网站看看吧。 当然,我们没有向模型提供任何关于我们咖啡店的实际信息(好吧,除了“社区”咖啡店这一点,而这确实把所以模型都引向了某个方向)。这种设计语言很时髦,但也许现在已经有点老套了(例如双字体、双色标题),但嘿——我们没有给它任何其他方向。 那么,Opus 的另外两次运行怎么样?(左边用了 [253 积分](https://6a6fa32903f0fac7ed28887d--ar-testing-coffee-4cae03c5378f.netlify.app/),右边用了 [249 积分](https://6a6faa299f2311f19d0e66ba--ar-testing-coffee-d73b1653d971.netlify.app/)) 也不错!矢量图形实际上需要模型做大量工作,上面的例子已经差不多处于 LLM *目前*能够达到的前沿水平(说实话,与图像或文本生成相比,这个领域的情况还不太好)。 至于第一个结果是否真的“好 4 倍”,意见可能各不相同。但在所有我做的测试中,Opus 确实比其他模型更容易出现积分消耗过高(相对于其“典型”基线)的情况。不过这并不保证结果更差或更好。这只是相当频繁*发生*的事情。 让我们看看其他一些模型,然后反思一下我们能学到什么。 ### Claude Sonnet 5 这是我们的三个候选,平均消耗 143 积分([81 积分](https://6a6fa3118e3202cc6e567749--ar-testing-coffee-024666b5136f.netlify.app/) · [245 积分](https://6a6fab0fa54baec9676aa982--ar-testing-coffee-fec1078e3bba.netlify.app/) · [103 积分](https://6a707ae1a8f69f351632aba6--ar-testing-coffee-53c45094318e.netlify.app/)): 每个结果仍然有一些讨喜的细节,只是*更少*(而且整体内容也更少)。矢量图形明显更简单,不太适合直接用于正式网站。这并不能说明该模型编写复杂代码或回答哲学问题的能力,但这不是我们在这里要求的。在这个价位上,让我们看看 OpenAI、Google 和 Kimi 能提供什么。 ### GPT 5.6 Sol(低努力) 当我们拿 OpenAI 的 Opus 级模型,并让它少花一点时间思考时,会发生什么? (平均 141 积分:[173 积分](https://6a6fa2978b6896cb693319f7--ar-testing-coffee-d66354fb412b.netlify.app/) · [158 积分](https://6a6fa98950d89fe74af76f3f--ar-testing-coffee-170e134f86fc.netlify.app/) · [92 积分](https://6a707a7ffb03ad3755a4a536--ar-testing-coffee-aeaf76325340.netlify.app/)) 看结果的话,我认为 OpenAI 的顶级模型在低努力模式下,至少在基本设计直觉方面,胜过 Anthropic 的中端模型,至少在这个场景下是这样。内容更丰富,也没有奇怪的矢量图形(不过图片有点普通)。 ### GPT 5.6 Terra 当我们下探 OpenAI 产品线的一个层级时(顺序是 Sol→Terra→Luna),我们会看到像刚才从 Anthropic 的 Opus 切换到 Sonnet 时那样的明显落差吗? 令人惊讶的是,情况并不完全如此:在这里,Terra 似乎有一种*不同的视觉语言*,而不一定更差。内容方面看起来确实更简单一些。有些视觉小瑕疵:左边运行结果中有一张图片缺失,中间那个在图片上有低对比度文本——但没有什么严重问题。 (平均 39 积分:[43 积分](https://6a6fa2e1afaf80aa13da0536--ar-testing-coffee-31dcbb8e514a.netlify.app/) · [23 积分](https://6a6fa9da89470b0ff1160411--ar-testing-coffee-9b6487579ea6.netlify.app/) · [49 积分](https://6a707a4ea2fdbb352df928c5--ar-testing-coffee-40263077bc51.netlify.app/)) 到目前为止,如果我对自己项目的设计和语言风格只有一个非常模糊的想法,我个人的倾向是用 Opus 5 和 GPT 5.6 Terra 分别运行同一个提示词,得到两个截然不同但都有价值的版本。 ### Gemini(3.6 Flash 和 3.1 Pro) 这两个模型不是同一代产品,这一点很明显:Gemini 3.6 Flash 实际产生了更好的结果(或者至少,与其他现代模型更一致),并且消耗的积分也比 Gemini 3.1 Pro 多。 以下是 Gemini 3.1 Pro 平均消耗 53 积分生成的内容。我甚至不在这里放在线网站的链接,因为真的没什么可看的。 是的,这些都是完全独立的运行结果。它做了我们在提示词中要求的事情,真的仅此而已。 另一方面,Gemini 3.6 Flash 看起来像是全新的一代,平均消耗了 103 积分([109 积分](https://6a6fa3376288679d094a8437--ar-testing-coffee-2b15c6a08894.netlify.app/) · [91 积分](https://6a6faa31c66359f0baf64680--ar-testing-coffee-ddce34e684da.netlify.app/) · [111 积分](https://6a707aac68023338d968539c--ar-testing-coffee-b14397da2ef1.netlify.app/))。它在内容方面也下了更多功夫。所有模型都会重复自己,但 Gemini 似乎重复得更多一些。 ### Kimi(K3 和 K2.7 Code) 好的,让我们来看

相似文章