PinSieve:生产环境选择性VLM服务与企业内容质量分诊的受控记忆飞轮

arXiv cs.LG 论文

摘要

PinSieve是一个用于企业内容质量分诊的生产案例研究,它使用了一个带有受控记忆飞轮的选择性视觉语言模型服务代理,导致审查生产力提高了25.7%,运营成本降低了16.2%。

arXiv:2608.24040v1 宣布类型:新 摘要:生产环境中的企业AI代理通常需要是有界的、有状态的、可观察的和可治理的,而不是完全自主的。我们介绍了PinSieve,一个在大规模内容质量流水线中的生产案例研究。其部署组件是一个选择性视觉语言模型(VLM)服务代理,仅操作在轻量级上游模型未解决的灰色地带片段上,在线暴露一个标量路由分数,并保留受控的人工升级。在此片段上,部署系统过滤的不可操作项比之前的生产模块多2.05倍,同时略微降低了估计的漏报率;在提升后,审查生产力提高了25.7%,标准化运营成本降低了16.2%,信号传递从次日变为当日。然后,我们研究了通过受控记忆飞轮在选择性反馈下的维护,其中升级项默认进行审查,自动通过项主要通过审计采样标记。反馈记忆记录路由轨迹、观察路径、审计倾向和用于评估和调试的重放元数据。数据策展代理使用一个有界的提议-验证器循环,涵盖代表性、不确定性、新鲜度和新鲜审查重放,并在批量接受前设置正向率和分数桶护栏。在六个月生产数据的链式月度刷新中,此设计将代表性随机重放下的平均FNR@50%从17.73%降低到13.29%。推理审查代理审计教师生成的推理并支持保留/修复/丢弃决策。生产声明仅归因于部署的服务代理;重放和推理审查结果是离线或采样治理证据。相同的服务代理配方已被采用到几个额外的内部信号,表明其可转移性超越单一任务。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:31

# PinSieve:生产环境中的选择性VLM服务与受控记忆飞轮——用于企业内容质量分级
来源:https://arxiv.org/abs/2608.24040  
查看PDF (https://arxiv.org/pdf/2608.24040)

> 摘要:生产环境中的企业AI智能体通常需要是受约束的、有状态的、可观测的和可治理的,而非完全自主。我们提出PinSieve,这是一个大规模内容质量流水线中的生产实践案例。其已部署的组件是一个选择性视觉语言模型(VLM)服务智能体,它仅处理由轻量级上游模型遗留下来的灰度区域数据,在线暴露一个标量路由分数,并保留受控的人工升级通道。针对该灰度区域,部署的系统比先前的生产模块多过滤了2.05倍的不可操作项,同时略微降低了估计遗漏率;上线后,它将审核生产力提高了25.7%,将归一化运营成本降低了16.2%,并将信号交付时间从次日缩短至当日。随后,我们研究了通过选择性反馈下的受控记忆飞轮进行维护,其中升级的项目默认会被审核,自动通过的项目则主要通过审计抽样进行标记。反馈记忆记录了路由追踪、观察路径、审计倾向和回放元数据,用于评估和调试。数据策展智能体使用了一个有界的提议-验证循环,基于代表性、不确定性、新鲜度和新审核回放进行,在批量接受前设有通过率和分数箱护栏。在对六个月生产数据进行链式月度刷新时,该设计将平均FNR@50%从代表性随机回放下的17.73%降低至13.29%。推理审核智能体对教师模型生成的理由进行审计,并支持保留/修复/丢弃决策。生产成果仅归因于已部署的服务智能体;回放和理由审核结果属于离线或抽样治理证据。相同的服务智能体方案已被采用到多个额外的内部信号中,表明其具有超越单一任务的可迁移性。

## 提交历史

来自:袁方 [查看邮件 (https://arxiv.org/show-email/0cadfc4f/2608.24040)] **[v1]** 2026年8月25日 星期二 03:57:56 UTC (512 KB)

相似文章

评估客服聊天代理系统的笔记:启发式评估器给出虚假信号,检索错误伪装成LLM失败,成本/质量的帕累托前沿往往不在你想的地方 [D]

Reddit r/MachineLearning

审计生产级客服RAG系统的实际发现:启发式评估器给出虚假信号,检索错误常伪装为LLM失败,成本与质量的帕累托前沿往往不在预期位置。模型扫查显示,用Gemma 4 26B替换原有模型(Gemini Flash Lite Preview)可在成本降低79%的同时实现19%的质量提升。