按代币计费是智能体的错误成本指标

Reddit r/AI_Agents 新闻

摘要

文章认为,代币价格作为AI智能体的成本指标并不充分,提出有效成本应通过成功运行和验证来衡量,并讨论了路由和失败策略。

对于智能体而言,有用的成本单位不是代币,甚至不是模型调用。它是通过模式、测试和实际重要的任何业务检查的运行。这改变了路由问题。一个强大的规划器可以定义约束条件、分配工作,并处理奇怪的案例。一个更快的执行器可以处理重复的工具调用,而测试框架负责通过/失败判断。这是一个相当标准的想法,但大多数成本比较仍然停留在输入和输出定价上。Ling-3.0-flash 在那个位置很有趣,因为其公开设计目标是低延迟、工具使用的执行。限制是设置的一部分:它仍然受益于显式的验证节点和结构化的错误反馈。这些验证器改变了计算方式。一次廉价调用后跟三次盲目重试并不便宜。一次更昂贵的调用如果在第一次尝试中就通过了门控,可能更便宜。而且,如果必须有人手工检查每个输出,更快的执行器仍然可能是一个糟糕的交易。我还没有确定的一个事情是升级规则。在两次验证失败后,你会把任务交还给规划器吗?只有在模式失败时?或者你设置每个接受结果的硬性预算,让路由器决定?对于运行多模型智能体的人来说,哪种边界最有效:任务类型、失败次数还是预算?
查看原文

相似文章

每百万Token的价格毫无意义

Hacker News Top

本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。