标签
Cline 对比了使用 Kimi 和 Fable 进行 Token 推理的成本,发现 Kimi 便宜 3-12 倍,并预测随着 Token 消耗量增长,自托管开源权重模型将成为企业标配,尤其是在 Kimi K3 等模型的推动下。
探索了NVIDIA Dynamo,这是一个用于在多个GPU集群节点上部署LLM的工具,具有模型缓存、自动扩展、多节点部署以及Kubernetes集成等功能。
STARIXNet是一种轻量级神经网络,通过捕获系统指标之间的多变量时空关系来改进云资源分配,优先考虑服务稳定性而非预测准确性。在沃尔玛部署后,它在保持服务可靠性的同时实现了10%-50%的成本节约。
一项基准研究发现,经过校准的基于规则的自动扩缩器在所有测试工作负载上成本均优于六种主流深度强化学习算法,而深度强化学习仅在突发流量模式中表现出更高成本下的优势。该论文提出了RLScale-Bench以改进评估协议和可复现性。
讨论了在预算有限的情况下为AI Agent管道扩展基础设施的实际挑战,强调了基于CPU/内存的自动扩展对于GPU推理工作负载的不足。