标签
本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。
一篇分析1350万次GitHub Copilot会话的微软论文显示,编码代理的工作负载主要由自主LLM调用链主导,KV缓存和容器空闲时间强烈依赖于回合/会话结构,主张采用工作流级调度而非请求级策略。
CreditGenie 使用 LangSmith 来调试数千条代理追踪,并从生产数据中生成有针对性的测试问题。
Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。
Replit构建了ViBench以根据自然语言规范评估应用构建成功率,以及Telescope来聚类生产环境故障轨迹,从而为使用闭源前沿模型的Agent实现框架级别和上下文级别的持续学习。
主张将生产轨迹作为AI后训练的数据,强调数据投入规模日益增长。
Benchling 的人工智能主管在一次技术演讲中讨论了分析生产追踪的模式。
LangChain 推出 LangSmith Engine 公测版,这是一个自主智能体,能够监控生产追踪、聚类故障、诊断根本原因,并提出修复和评估覆盖建议,以简化智能体开发。
TRACER是一个开源系统,它在LLM分类端点的生产追踪数据上训练轻量级机器学习代理,并通过一个一致性门控路由请求,仅当代理与原始模型的一致性超过指定阈值时才激活代理。该方法在意图分类基准上实现了83-100%的代理覆盖率,同时保持了对处理边界和故障模式的可解释性。