标签
Andrej Karpathy 的斯坦福讲座提供了 AI 工程的简洁解释,重点是围绕模型构建系统,包括上下文、记忆、工具和反馈循环。
InfraBench is a benchmark suite for evaluating AI agents on realistic infrastructure management tasks across the full stack, lifecycle, and risk levels. Experiments show that even the strongest agent configurations achieve only 40-88% effective scores and struggle with consistency and safety.
Hacker News 上关于计算机系统是否已准备应对首次负闰秒的讨论,评论中争论了风险以及闰分钟等替代方案。
一篇题为《The Hitchhiker's Guide to Agentic AI: From Foundations to Systems》的论文提供了关于LLM和代理型AI基础的全面教科书式资源。
一条推文分享了 Brendan Gregg 精选的推荐书单,涵盖系统性能、语言性能、数据库性能及其他计算机科学领域。
分享一份GitHub上的机器学习系统笔记,涵盖大语言模型训练推理相关的分布式计算、并行化、量化和PyTorch内部机制,适合对ML系统感兴趣的学习者。
讨论了强化学习训练基础设施中沙盒启动延迟和扩展能力如何显著影响训练性能,引用了SemiAnalysis对匹配训练器和生成器吞吐量的详细分析。
开发者从零开始用C语言构建了一个多客户端终端聊天应用,使用原始TCP套接字和select()进行I/O多路复用,作为构建EduOS(一个面向非洲学校的隐私优先、AI原生操作系统)的一步。
ObjectCache提出使用S3兼容的对象存储来实现LLM KV缓存的重用,以降低成本并增加容量,同时通过协同设计的存储协议和传输调度将延迟开销降至最低。实验表明,对于64K上下文,相比本地DRAM仅增加5.6%的延迟。
一场关于LLM部署技术的讲座,涵盖AWQ、vLLM、FlashAttention、量化和激活平滑,以实现高效服务。
本文介绍了 DMI-Lib,这是一种高速深层模型检查器,通过将监控与推理热点路径解耦,实现了大语言模型推理的高效内部可观测性。