llm-cost

标签

Cards List
#llm-cost

不是所有事情都需要代理——我用来决定使用代理还是脚本的三个问题

Reddit r/AI_Agents · 2026-09-03

作者分享了三个问题,用于决定在AI代理和脚本之间选择,强调了程序知识、项目数量和独立性,以及成本和速度的权衡。

0 人收藏 0 人点赞
#llm-cost

@tomaarsen: 成本低1400倍,我知道我将坚持使用嵌入(密集、稀疏、多向量),加上混合方法(包括bm25)和重排……

X AI KOLs Following · 2026-08-21 缓存

一项关于嵌入与大语言模型成本效益的讨论,引用了名为'embedder's dilemma'的研究,该研究发现大语言模型以显著更高的成本超越了嵌入模型。

0 人收藏 0 人点赞
#llm-cost

全量召回,代价几何?智能体记忆系统的服务成本基准测试

arXiv cs.CL · 2026-08-13 缓存

本文对三种智能体记忆系统(Mem0、Hindsight、Mastra Observational Memory)与参考策略在多种对话主干模型上的服务成本进行了基准测试,发现成本主要由内部记忆行为驱动,盈亏平衡点差异很大,且没有系统能在成本和准确性上同时胜出。

0 人收藏 0 人点赞
#llm-cost

我测量了13个搜索API在智能体内运行的实际成本。定价页只是账单中较小的一半

Reddit r/AI_Agents · 2026-08-06

一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。

0 人收藏 0 人点赞
#llm-cost

我认为“使用更少的token”作为LLM成本建议过于肤浅

Reddit r/AI_Agents · 2026-07-03

本文认为,常见的专注于减少token的LLM成本建议过于肤浅,而在生产环境中更具影响力的策略是,将不同的工作流步骤路由到不同的模型,而不是使用单一的默认模型。

0 人收藏 0 人点赞
#llm-cost

为什么感觉大型LLM提供商在故意隐藏提示缓存?

Reddit r/artificial · 2026-07-01

一篇文章讨论提示缓存如何大幅降低LLM API成本,指出提供商对此解释不足,并提供一个简单的规则来构建提示以获得最大缓存命中率。

0 人收藏 0 人点赞
#llm-cost

@gneubig: 我们发现这种 "sidekick" 架构在降低LLM成本方面非常有效,因为它允许你...

X AI KOLs Following · 2026-06-29 缓存

Graham Neubig 分享了一种通过将简单任务委托给较小的智能体来降低LLM成本的 sidekick 架构,并提供了一个使用 OpenHands SDK 的200行示例。这种方法也被用于 Cognition 的 Devin Fusion 混合模型 harness。

0 人收藏 0 人点赞
#llm-cost

@LinusEkenstam: ROT — 代币回报(Return on Tokens)。我们都知道终有一天会走到这一步。从一开始,Tokenmaxxing 就是个愚蠢的主意。它……

X AI KOLs Following · 2026-06-29 缓存

作者批评了在LLM使用中追求token最大化的趋势,并主张通过优化和路由转向代币回报(ROT),以实现可持续的AI部署。

0 人收藏 0 人点赞
#llm-cost

非洲语言税:量化前沿大语言模型中分词非洲语言的成本、延迟和上下文惩罚

arXiv cs.CL · 2026-06-24 缓存

本文系统量化了20种非洲语言在11个前沿和开源分词器上的分词惩罚,发现推理成本和延迟最高可达8.9倍,有效上下文窗口仅为英语的11%,突显了子词词汇表中编码的结构性数字鸿沟。

0 人收藏 0 人点赞
#llm-cost

智能体成本主要来自上下文,而非补全

Reddit r/AI_Agents · 2026-06-17

这篇文章认为,AI 智能体系统的主要成本来自处理上下文(输入令牌),而非生成补全(输出令牌)。

0 人收藏 0 人点赞
#llm-cost

如何阻止失控的LLM API支出在调用发出之前(调用前预算执行)

Reddit r/ArtificialInteligence · 2026-06-16

一份实用指南,介绍如何为LLM API调用实施调用前预算执行,涵盖估算、对账、故障开放决策、范围预算和并发处理,以防止失控成本。

0 人收藏 0 人点赞
#llm-cost

@hasantoxr: 所以我发现了一个GitHub仓库,它可以阻止AI代理无谓地消耗token。它叫Headroom。它是由一位……

X AI KOLs Timeline · 2026-06-14

Headroom是Netflix的Tejas Chopra开发的一个GitHub工具,它能在将输入(工具输出、日志、RAG块等)发送给LLM之前进行压缩,承诺在不改变答案的前提下减少60–95%的token。它支持Python/TypeScript库、本地代理、MCP服务器,以及针对流行编程代理的封装器。

0 人收藏 0 人点赞
#llm-cost

Anthropic/OpenAI可能每从你那里收取100美元,实际支出却超过1000美元(39分钟阅读)

TLDR AI · 2026-06-08 缓存

一项分析表明,像Anthropic和OpenAI这样的AI公司每获得100美元收入,可能实际花费超过1000美元,凸显了LLM市场不可持续的经济状况。

0 人收藏 0 人点赞
#llm-cost

Show HN: Lowfat – 可插拔的CLI过滤器,为我省下了91.8%的LLM令牌

Hacker News Top · 2026-06-05 缓存

Lowfat是一个轻量级的CLI过滤器,通过在被代理工具接收前剔除不必要的输出来降低AI令牌成本,声称可节省高达91.8%的令牌。它提供Shell集成、插件支持,以及针对Claude Code和OpenCode等工具的透明重写功能。

0 人收藏 0 人点赞
#llm-cost

Token消耗狂飙正成为一类生产事故。你如何为AI代理费用设置上限?

Reddit r/AI_Agents · 2026-05-30

AI代理导致Token消耗失控,使超支成为一类生产事故。文章列举了诸如一位工程师130万美元的OpenAI账单以及Uber在四个月内烧掉全年AI预算等案例,并向社区询问如何为代理费用设置上限。

0 人收藏 0 人点赞
#llm-cost

Apple Silicon 的成本高于 OpenRouter

Hacker News Top · 2026-05-17 缓存

每百万 token 的成本对比:在 Apple Silicon 硬件上本地运行 LLM 与通过 OpenRouter 使用云推理的成本比较,发现本地推理通常贵 3 倍且更慢。

0 人收藏 0 人点赞
#llm-cost

@FinanceYF5: 1/ 认知价格在崩塌 LLM 的智能价格 18 个月跌了 100 倍,这是事实。 但 David 说,悲观派看到这里就停了——他们漏掉了下半场:投入变便宜,需求会向外扩张。

X AI KOLs Following · 2026-05-10 缓存

文章指出LLM智能价格在18个月内下跌了100倍,并分析认为成本的降低将推动需求向外扩张,反驳了单纯的悲观看法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈