视觉 vs 描述。将任务拆分成不同模型的效果比预期更好。
摘要
用户分享了一个经验:将视觉编码任务拆分为 Gemini(从图像生成 XML 描述)和 Claude(生成 Next.js/Tailwind 代码)两个部分,相比单独使用 Claude,提高了准确性并降低了 token 成本。
大约一小时前,我在使用 Claude 项目编写代码。我正在构建我的网站,并考虑从 Image 2 生成原型,然后使用 Claude。我要求它根据显示的图像提供 Next.js 和 Tailwind 的组件。但它生成了胡言乱语。视觉描述完美地处理了所有视觉元素,但 Claude 无法将其编码,生成了一些……*可耻*的内容。因此,尽管 Claude 擅长编码和创意写作,但在分析图像时却完全不行。经过简短研究后,我使用 Gemini 通过 XML 正确定义了视觉内容。然后将 XML + 视觉内容粘贴到 Claude 中。结果它生成了与显示完全一致的内容(只是背景为黑色并做了一些调整)。之前我的成本是:250K token = 废话。之后,成本是:140K token。成本更低,但结果实际上大不相同。对此你怎么看?PS:顺便说一下,我正在考虑制作一部纪录片,讨论如何使用 LLM 构建强大的 SaaS。我会讨论我的失败和领悟。只是说说而已 ^_________^ 。如果我不适合这个子论坛,请点踩并评论。
相似文章
难怪 Qwen 和 Gemma 差异这么大
一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。
LLM-as-a-Judge测试:Gemini与Claude在生成单页HTML学习指南中的对比。
一项比较研究,通过LLM-as-a-Judge方法评估Gemini和Claude AI模型在生成单页HTML学习指南方面的能力。
在同一仓库中运行 Claude Code、Codex 和 Gemini CLI 作为编码代理一周——它们各自的薄弱环节。
一位开发者在一周内对比了 Claude Code、Codex 和 Gemini CLI 三种编码代理,指出了它们在上下文处理、精确度和上下文大小方面的优势,以及在成本、模糊处理能力和一致性方面的不足。
介绍 Gemini 的代理式视频理解
Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。
@googleaidevs:我们想看看Gemini 3.5 Flash-Lite如何处理大规模、重复性的视觉任务。此演示让模型处理超过100万张…
Google AI 演示了 Gemini 3.5 Flash-Lite 处理超过100万张目录图片,以低延迟和高效令牌提取结构化数据,适用于大规模工作流。