我觉得重度AI用户可能在任务分配上消耗的计算资源比在提示部分更多

Reddit r/artificial 新闻

摘要

作者建议,重度AI用户可能因未优化模型选择而导致模型资源分配低效,提出应将任务路由到能胜任且成本最低的模型,以节省开支并提高效率。

我在运行一个用于实际工作的多代理系统时,注意到一些反直觉的现象。当我手动使用一个长时间的 Codex/ChatGPT 会话时,我通常在开始时做一个粗略的决定:使用哪个模型?哪个推理级别?然后相同的配置会处理规划、研究、简单检查、复杂推理、修订,甚至验证。这感觉越来越低效。在我尝试的系统中,工作被分解了。有些步骤是确定性的,完全不使用模型。有些步骤使用更便宜/更快的模型。困难或模糊的步骤使用更强的推理。验证是分开的。如果初始选择失败,系统可以升级处理,而不是从一开始就支付最高成本。令人惊讶的结果是,多个较小的模型运行可能看起来比一次大型手动运行消耗更少的付费容量。我并不是说这已经得到证实。配额消耗还受上下文大小、工具、后台/子代理活动和平台端效率问题的影响,所以‘用户只是选错了模型’这种说法过于简化。但这让我思考,模型选择是否应该被视为资源分配,而不是聊天偏好。在公司里,你不会把每项任务都分配给最昂贵的高级专家。你会把工作路由到能可靠处理的最低成本级别,然后处理异常情况。也许 AI 系统应该以同样的方式工作。对于运行大规模代理系统的人:你们是否真的在测量模型/推理组合和每个验证结果的容量,还是主要为整个工作流选择一个模型?
查看原文

相似文章

我们是否默认过度配置了AI智能体?

Reddit r/AI_Agents

文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。

每个AI提示都需花费成本——这改变了一切

Reddit r/AI_Agents

文章认为,AI的真正挑战不仅在于构建更智能的模型,更在于以规模化的方式降低成本效率,强调了减少token使用、提升速度以及优化基础设施的重要性。

模型路由的第一性原理

Hacker News Top

本文概述了有效AI模型路由的第一性原理,强调保持模型差异化、限制池大小、使用相对实际基准以及评估过去的路由决策以实现更好的性能。