本地 Qwen 3.8 27B 对比 GPT-5.6 Terra 与 Grok 4.6
摘要
本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。
我给三个AI模型相同的简报:基于相同的Git基线,独立且不协作地构建一个高端Three.js香水发布网站。结果截然不同。以下是完整的对决
Qwen 3.8 27B - Ollama 本地:
- 报告的实现:模块化的Three.js架构,程序化透射玻璃瓶、内部液体和树脂瓶盖、轨道环和卫星,约740个粒子,五阶段滚动时间线,拖拽轨道交互,由香气驱动的颜色变化,持久化等待列表,WebGL回退和减弱运动模式。
- 从实现证据看,显著优势:这是架构最广泛的条目——16个文件和超过3,000行新增代码,包含独立的场景、瓶子、粒子、背景、时间线、相机、部分和表单模块。
- 潜在问题:生产JavaScript包约545 KB未压缩,且代理本身无法以编程方式验证WebGL像素。
GPT-5.6 Terra - ChatGPT 订阅:
- 报告的实现:程序化瓶子、液体、瓶盖、标签和轨道光晕;编辑式构图;氛围颗粒;大字体;交互式香气星座;滚动揭示;表单验证和减弱运动支持。
- 从实现证据看,显著优势:其本地站点保持可访问,且页面内容展示了有力而克制的营销文案,如“重力与光芒的研究”、“香气近在咫尺”以及结构化的嗅觉叙事。
- 潜在问题:它集中到仅main.js和style.css,使得代码不如Qwen的实现模块化。等待列表仅限于客户端。
Grok 4.6 - xAI OAuth:
- 报告的实现:车削烟熏水晶瓶、液体、锡青铜项圈、画布渲染的No. 7标签和轨道环;指针视差;滚动旋转;部分链接的颜色变化;键盘可访问的香气标签页;重复地址处理和localStorage等待列表持久化。
- 从实现证据看,显著优势:实用的可访问性和表单行为似乎特别周到,包括跳过链接、键盘操作的标签页和重复电子邮件处理。
- 潜在问题:它是最紧凑和传统结构的实现,可能不如Qwen和Terra条目在视觉上雄心勃勃。物理瓶材质也可能对较弱的移动GPU造成压力。
严格基于实现证据:
Qwen 3.8 27B - 最强的技术雄心和完整性
GPT-5.6 Terra - 最强的展示文案和编辑营销方向
Grok 4.6 - 最强的紧凑性和务实交互细节
GitHub Website
相似文章
Qwen3.8 (27b) 在智能体任务上优于 GPT-5.6-Terra (Max)
本文报道了AI模型的性能表现,基于Agentic Index分数显示,Qwen3.8 (27b)在智能体任务中超越了GPT-5.6-Terra (Max)。
GPT-5.6, Grok 4.5, Claude 和 Muse Spark 构建相同的4个应用
对十二个AI模型的详细比较,包括GPT-5.6、Grok 4.5、Claude以及开放权重模型,被要求多次尝试构建四个不同的应用程序,所有成果均已公开以供独立评估。
Grok 4.6
xAI releases Grok 4.6, a frontier model focused on long-running agents and ambitious interactive/visual work, matching GPT-5.6 Sol on the Artificial Analysis Intelligence Index and available in Cursor and Grok Build.
我们让 Grok 4.5、GPT-5.5 和 Claude 构建了相同的应用
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。