标签
本文分享了《How to scale your model》一书中关于推理的专门章节,涵盖了Transformer模型的关键优化技术,如KV缓存和延迟分析。
本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。
Google Startups发布了一份新的技术指南,用于使用Google DeepMind的模型构建生成式媒体应用,内容涵盖模型、工具、架构、质量保证和经济考量。
一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。
Perplexity 团队公开了 Agent Skills 的设计、迭代与维护规范,强调 Skill 编写并非传统编码,而是为模型构建上下文。文章提出了以评测为先、渐进式加载及通过处理特例(Gotchas)来优化 Agent 行为的反直觉方法论。
全面的科普指南,介绍从802.11n (Wi-Fi 4)到802.11bn (Wi-Fi 8)的Wi-Fi标准演进,涵盖MIMO、DFS信道、吞吐量预期等技术细节,并为消费者提供实用的路由器选购建议。