本地 Qwen 3.8 27B 对比 GPT-5.6 Terra 与 Grok 4.6

Reddit r/artificial 新闻

摘要

本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。

我给三个AI模型相同的简报:基于相同的Git基线,独立且不协作地构建一个高端Three.js香水发布网站。结果截然不同。以下是完整的对决 Qwen 3.8 27B - Ollama 本地: - 报告的实现:模块化的Three.js架构,程序化透射玻璃瓶、内部液体和树脂瓶盖、轨道环和卫星,约740个粒子,五阶段滚动时间线,拖拽轨道交互,由香气驱动的颜色变化,持久化等待列表,WebGL回退和减弱运动模式。 - 从实现证据看,显著优势:这是架构最广泛的条目——16个文件和超过3,000行新增代码,包含独立的场景、瓶子、粒子、背景、时间线、相机、部分和表单模块。 - 潜在问题:生产JavaScript包约545 KB未压缩,且代理本身无法以编程方式验证WebGL像素。 GPT-5.6 Terra - ChatGPT 订阅: - 报告的实现:程序化瓶子、液体、瓶盖、标签和轨道光晕;编辑式构图;氛围颗粒;大字体;交互式香气星座;滚动揭示;表单验证和减弱运动支持。 - 从实现证据看,显著优势:其本地站点保持可访问,且页面内容展示了有力而克制的营销文案,如“重力与光芒的研究”、“香气近在咫尺”以及结构化的嗅觉叙事。 - 潜在问题:它集中到仅main.js和style.css,使得代码不如Qwen的实现模块化。等待列表仅限于客户端。 Grok 4.6 - xAI OAuth: - 报告的实现:车削烟熏水晶瓶、液体、锡青铜项圈、画布渲染的No. 7标签和轨道环;指针视差;滚动旋转;部分链接的颜色变化;键盘可访问的香气标签页;重复地址处理和localStorage等待列表持久化。 - 从实现证据看,显著优势:实用的可访问性和表单行为似乎特别周到,包括跳过链接、键盘操作的标签页和重复电子邮件处理。 - 潜在问题:它是最紧凑和传统结构的实现,可能不如Qwen和Terra条目在视觉上雄心勃勃。物理瓶材质也可能对较弱的移动GPU造成压力。 严格基于实现证据: Qwen 3.8 27B - 最强的技术雄心和完整性 GPT-5.6 Terra - 最强的展示文案和编辑营销方向 Grok 4.6 - 最强的紧凑性和务实交互细节 GitHub Website
查看原文

相似文章

Grok 4.6

Hacker News Top

xAI releases Grok 4.6, a frontier model focused on long-running agents and ambitious interactive/visual work, matching GPT-5.6 Sol on the Artificial Analysis Intelligence Index and available in Cursor and Grok Build.

我们让 Grok 4.5、GPT-5.5 和 Claude 构建了相同的应用

Reddit r/singularity

本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。

@elonmusk: Grok Build

X AI KOLs Timeline

Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。