PinSieve:生产环境选择性VLM服务与企业内容质量分诊的受控记忆飞轮
摘要
PinSieve是一个用于企业内容质量分诊的生产案例研究,它使用了一个带有受控记忆飞轮的选择性视觉语言模型服务代理,导致审查生产力提高了25.7%,运营成本降低了16.2%。
查看缓存全文
缓存时间: 2026/08/26 09:31
# PinSieve:生产环境中的选择性VLM服务与受控记忆飞轮——用于企业内容质量分级 来源:https://arxiv.org/abs/2608.24040 查看PDF (https://arxiv.org/pdf/2608.24040) > 摘要:生产环境中的企业AI智能体通常需要是受约束的、有状态的、可观测的和可治理的,而非完全自主。我们提出PinSieve,这是一个大规模内容质量流水线中的生产实践案例。其已部署的组件是一个选择性视觉语言模型(VLM)服务智能体,它仅处理由轻量级上游模型遗留下来的灰度区域数据,在线暴露一个标量路由分数,并保留受控的人工升级通道。针对该灰度区域,部署的系统比先前的生产模块多过滤了2.05倍的不可操作项,同时略微降低了估计遗漏率;上线后,它将审核生产力提高了25.7%,将归一化运营成本降低了16.2%,并将信号交付时间从次日缩短至当日。随后,我们研究了通过选择性反馈下的受控记忆飞轮进行维护,其中升级的项目默认会被审核,自动通过的项目则主要通过审计抽样进行标记。反馈记忆记录了路由追踪、观察路径、审计倾向和回放元数据,用于评估和调试。数据策展智能体使用了一个有界的提议-验证循环,基于代表性、不确定性、新鲜度和新审核回放进行,在批量接受前设有通过率和分数箱护栏。在对六个月生产数据进行链式月度刷新时,该设计将平均FNR@50%从代表性随机回放下的17.73%降低至13.29%。推理审核智能体对教师模型生成的理由进行审计,并支持保留/修复/丢弃决策。生产成果仅归因于已部署的服务智能体;回放和理由审核结果属于离线或抽样治理证据。相同的服务智能体方案已被采用到多个额外的内部信号中,表明其具有超越单一任务的可迁移性。 ## 提交历史 来自:袁方 [查看邮件 (https://arxiv.org/show-email/0cadfc4f/2608.24040)] **[v1]** 2026年8月25日 星期二 03:57:56 UTC (512 KB)
相似文章
FleetSieve:面向SLO感知LLM舰队配置的决策关键型分析方法
FleetSieve提出了一种针对SLO感知LLM舰队配置的决策关键型分析方法,通过精简测量来优化资源分配,实现了相比均匀分析更高的效率。
FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents
FinCacheServe is a system for dependency-consistent answer reuse in RAG serving over mutable enterprise documents, using document versions, evidence fingerprints, and tool fingerprints to invalidate caches. Evaluations show it skips over 53% of LLM calls with zero stale outputs, reducing GPU cost compared to versioned semantic caching.
QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存
本文介绍了QV-PIC,一种查询感知的双分辨率位置无关缓存框架,用于高效的RAG服务,相比朴素渲染图像PIC,F1值提升21.6个点,同时相对于完整预填充将首令牌时间降低83.8%。
评估客服聊天代理系统的笔记:启发式评估器给出虚假信号,检索错误伪装成LLM失败,成本/质量的帕累托前沿往往不在你想的地方 [D]
审计生产级客服RAG系统的实际发现:启发式评估器给出虚假信号,检索错误常伪装为LLM失败,成本与质量的帕累托前沿往往不在预期位置。模型扫查显示,用Gemma 4 26B替换原有模型(Gemini Flash Lite Preview)可在成本降低79%的同时实现19%的质量提升。
RED-PIM: 使用处理内存减少Transformer的数据移动
提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。