标签
分析了按 token 计费的 LLM 定价如何激励冗长输出,并提出了低熵提示约束(FAOA)以降低成本并提高语义密度。
一项跨Anthropic、OpenAI、Gemini和DeepSeek的详细测量研究发现,传统的30秒提示缓存保活频率过高8倍;4分钟间隔是最优的,并且只有在长时间空闲间隔下,Anthropic的缓存才能节省成本。
提出了一种缓存感知的提示压缩(CAPC)方法,该方法将查询无关的压缩与缓存相结合,以降低大语言模型API的成本,在Anthropic的Sonnet API和生产工作负载上展现出显著优于现有方法的节省效果。
Sakana AI推出多模型编排API Fugu,此前Anthropic暂停了对Claude Fable 5和Mythos 5的访问。Fugu Ultra在LiveCodeBench上获得93.2分,表现优于Fable 5,起价为每百万输入代币5美元。
Bash4LLM+ 是一个轻量级、无依赖的 Bash 封装器,用于 LLM API,提供与 Groq 及其他提供者的安全、可审计交互,具有动态模型列表、流式输出和可扩展附加功能等特点。
FreeLLMAPI 是一个开源工具,将 16 家 LLM 提供商的免费额度聚合为一个 OpenAI 兼容端点,自动路由和用量跟踪,每月总计约 17 亿 Token。
作者注意到,尽管Hugging Face上存在像MedGemma和BioMistral这样的模型,但面向医疗的LLM公开可用的API却出人意料地缺乏,并询问是否有任何可用的选项。
FreeLLMAPI 是一款开源工具,它将11家主流大语言模型提供商的免费套餐汇聚到一个兼容OpenAI的单一接口中,通过路由请求并管理速率限制,每月提供约10亿+token。它通过一台本地服务器简化了对多个免费模型的访问。
OpenAI 在其 API 中引入了结构化输出功能,使开发者能够可靠地从语言模型获取符合 JSON Schema 的输出,改进与下游系统的集成并减少解析错误。