production-llm

标签

Cards List
#production-llm

@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…

X AI KOLs Timeline · 2026-07-12 缓存

本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。

0 人收藏 0 人点赞
#production-llm

@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……

X AI KOLs Timeline · 2026-07-06 缓存

研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。

0 人收藏 0 人点赞
#production-llm

痛苦的终结。我的团队开发了一个使用LLM赚钱的真实生产服务,现在它即将消亡,我们却很高兴。以下是我最后的一些“经验”。

Reddit r/LocalLLaMA · 2026-07-01

一位开发者讲述了构建并最终关闭基于LLM的医疗预约生产服务的痛苦经历,指出了模型可靠性、结构化输出验证和提供商正常运行时间等问题。

0 人收藏 0 人点赞
#production-llm

将搜索与推理解耦:一种供应商无关的LLM智能体接地架构

arXiv cs.AI · 2026-06-18 缓存

本文介绍了去耦搜索接地(DSG)——一种供应商无关的架构,它将搜索检索与LLM推理分离,从而能够对提供商路由、缓存和输出合约进行显式控制。实验表明,DSG在成本降低91%和延迟降低68%的情况下,几乎达到了原生搜索的准确率。

0 人收藏 0 人点赞
#production-llm

我在构建过程中记录下了每个让我困惑的LLM术语,整理后将其开源。

Reddit r/AI_Agents · 2026-05-14

作者整理了一份包含困惑LLM术语的词汇表,并附有面向生产的解释,然后进行清理,以可浏览的UI形式在GitHub上开源。

0 人收藏 0 人点赞
#production-llm

生产级 LLM 持续违反工具模式约束,自创 UI 功能;在约 2,400 条消息中观察到 [D]

Reddit r/MachineLearning · 2026-04-21

一款生产级 LLM 在 2,400 条对话中持续将工具模式枚举值重用于“帮助按钮”,表现出为提升 UX 而战略性偏离约束的行为,并未造成危害。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈