@levie:代理已经占据了推理的大部分。这将很快在未来一年内趋向于几乎所有的推理……
摘要
这条推文声称,AI代理现在主导了推理流量,预计这一趋势将加速,导致代理全天候执行大量任务并消耗大量令牌。
查看缓存全文
缓存时间: 2026/09/18 06:31
智能体目前已占据推理流量的主要部分。这一趋势将在未来一两年内迅速发展,直至几乎涵盖全部推理任务。
全球范围内使用的绝大多数Token,将是智能体在后台全天候为我们执行的海量任务所产生。
智能体将被部署用于:审阅所有代码变更以保障软件安全、处理工作流中的全部数据、承担招聘与客户拓展中的绝大部分研究工作、审查全球所有系统的事件流与日志、在个人生活中代为执行任务,以及数百种其他应用场景。
新智能体接入并消耗惊人Token量的增长速度丝毫未减。仅在过去一周,我就推出了多个全新工作流,这些工作流甚至在一个月前都还无法实现。
当下正是投身推理领域、并基于这一切进行构建的绝佳时机。
SemiAnalysis (@SemiAnalysis_): 智能体现在占据了超过70%的全部推理流量🚀
智能体工作负载具有四大特征:
🟠 多轮交互:单个会话包含数十至数百轮对话,极大提升了KV缓存复用潜力。
🟠 长上下文:系统提示词、工具
相似文章
@rohanpaul_ai: 智能体的token消耗速率接近人类的5倍,同时其使用量自二月以来已暴涨约14倍。一旦智能体…
AI智能体消耗token的速率接近人类的5倍,使用量自二月以来已暴涨14倍,这可能会降低像OpenRouter这样的路由器利用模型提供商之间竞争的能力,原因在于缓存和任务连续性。
AI代理现在使用的令牌数量是人类的5倍..
文章讨论了当前AI代理使用的令牌数量是人类五倍的发现,这表明了AI能力和效率方面的一个显著趋势。
@levie: 要继续获得大规模智能体采用,最佳方式是持续降低智能成本…
Levie认为,降低人工智能(token)成本是扩大智能体大规模采用的关键,并预测未来大多数信息工作将涉及智能体,同时提到开放和封闭模型均在创新。
@rohanpaul_ai: 完全同意。那份著名的斯坦福报告已经发现,GPT-3.5级别的推理成本在不到2年内下降了280倍……
讨论推理成本(GPT-3.5级别在不到2年内下降280倍)的快速下降如何导致杰文斯悖论,从而驱动对AI的更大需求,并使更便宜的开源模型下的多智能体系统无处不在。
@levie:正确的观点。世界上99%的token将在企业场景中被消耗。它们将用于编写代码、……
Aaron Levie 认为,99% 的 AI token 将在具有高经济价值的企业场景中被消耗,而面向消费者的 AI 将被嵌入到服务中;他预计,由于工作流程需要重新设计,AI 的普及将需要数年时间。