标签
作者们用纯 JAX 创建了一个轻量级、高性能的异步强化学习堆栈,分享了一份关于推理、RDMA 权重传输、内存优化以及用于扩展 RL 系统的分片的见解的工作日志。
一个LLM编码代理实现多组件数据系统的案例研究,分析缺陷并在HotpotQA上评估检索策略,突出了自动化与实证测试之间的差距。
本文介绍了通过销售系统、服务、制品和掌控垂直领域在机器人行业赚取收入的多种途径,强调了行业对实用工程技能的依赖,而非单纯的AI开发。
文章认为,最大的AI转变不是更大的模型,而是围绕它们的更好系统,例如上下文、模型路由、缓存、代理工作流和评估,使模型成为引擎,系统成为产品。
作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。
本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。
哈佛大学开源了一套全面的两卷本机器学习系统教科书,涵盖针对现实约束工程化AI系统,包括分布式训练、生产推理、边缘部署和治理,并配有TinyTorch、硬件套件和交互工具等实践组件。
DeepSeek发布了DSpark,该系统让主模型快速生成一个句子,同时一个小型编辑器在验证前修正连贯性,将大语言模型系统工程推向新架构之外。
本文回顾了过去十年中人工智能系统工程(AI4SE)和系统工程人工智能(SE4AI)的进展,识别出五个关键研究空白,并提供了一个人机一致性数据集和用于相关性判断的网络探索工具。