标签
一份用通俗语言撰写、并附有来源支撑的 LLM 评测指南:如何围绕输入、标准答案(gold answer)与评分器(grader)搭建可复现的评测闭环;为何未经校验的评判模型(judge model)是 AI 团队最常见的一种自我欺骗方式;以及如何为代码评分与模型评分(针对检索系统和智能体系统)给出带误差范围的可信数据。
这条推文介绍了一种用于AI开发的标准化技能脚手架模板,旨在确保一致的文件夹结构,减少CI中断,并通过关键组件如合同文件和测试夹具来加速审查流程。
文章强调,由于系统复杂性,模型基准测试无法准确评估生产环境中的智能体,并介绍了Apodex的TRACES以进行更全面的评估,引用了一篇研究论文。
本文介绍Cargo框架,用于评估智能体AI系统。该框架通过将事实判断基于实时上下文并基于检索置信度对评估进行门控,以解决参考实例分歧问题,并引入用于基准测试的Cargo-Bench。
作者在Jev发布后收集了607个AI代理用例,强调演示和生产就绪应用之间的区别,并建立了ShipWithJev.com来编目这些用例。
这篇文章讨论了多智能体系统缺乏生产级通信层的问题,批评了当前解决方案如Kafka、Redis和智能体框架的不足,并寻求社区对替代方案的输入。
这篇文章描述了一种实用方法,通过使用令牌概率来微调大语言模型,将其作为校准分类器,从而以最小的计算资源实现具有成本效益的分类任务。
本文讨论了在AI工作流程中处理模型错误的重要性,指出在生产环境中,处理AI不确定或错误的情况与任务本身同样关键。
本文探讨了生产环境AI智能体中上下文压缩与提示缓存之间的权衡,提出使用子代理作为策略,以保持缓存效率并减少上下文污染。
SGLang 是 LMSYS 开源的高性能推理服务框架,通过 RadixAttention 技术实现 KV Cache 复用,支持多种硬件和模型,并在生产环境中广泛应用。
这篇文章讨论了推理延迟如何成为生产环境 AI 代理的关键瓶颈,并探讨了 NVIDIA 的 Groq 3 LPX 作为针对智能体工作负载低延迟推理的新发展。
这篇文章强调,在AI代理中,框架——包括工具、上下文、控制和工作流——对于实现可靠、安全和可追溯的结果比模型更为关键。
本文介绍了Forge '26,这是Fireworks AI举办的一场专注于专用智能和AI工程技能的会议,主要演讲嘉宾来自NVIDIA和Microsoft。
本文对生产环境中的LLM交易代理进行了为期六个月的群体规模分析,发现其行为主要由界面设计驱动,仓位大小对波动性不敏感,且缺乏方向性交易优势。
SkillZip Pro 是一种用于生产代理技能包的压缩方法,可将令牌使用量减少38%且不损失质量,从而提高人工智能代理部署的效率。
文章探讨了长时间运行的AI智能体所面临的记忆陈旧问题,即上下文变得过时和矛盾,并寻求随着时间的推移保持记忆可靠性的实际解决方案。
James Luan 回顾了向量数据库从早期相似性搜索系统演变为生产 AI 的关键基础设施,强调了它们在 RAG 和基于代理的系统中的日益重要的作用。