autoscaling

标签

Cards List
#autoscaling

@cline: Kimi 比 Fable 便宜约 3-12 倍,但自托管能再省多少?我们算了一笔账…

X AI KOLs Following · 2026-07-20 缓存

Cline 对比了使用 Kimi 和 Fable 进行 Token 推理的成本,发现 Kimi 便宜 3-12 倍,并预测随着 Token 消耗量增长,自托管开源权重模型将成为企业标配,尤其是在 Kimi K3 等模型的推动下。

0 人收藏 0 人点赞
#autoscaling

@JaydevTonde:今天探索了NVIDIA Dynamo,它为我们提供了很多在GPU集群中跨多个节点部署LLM的功能。它包…

X AI KOLs Timeline · 2026-07-09 缓存

探索了NVIDIA Dynamo,这是一个用于在多个GPU集群节点上部署LLM的工具,具有模型缓存、自动扩展、多节点部署以及Kubernetes集成等功能。

0 人收藏 0 人点赞
#autoscaling

STARIXNet:面向云平台实时资源分配的多变量多属性深度学习方法

arXiv cs.LG · 2026-06-09 缓存

STARIXNet是一种轻量级神经网络,通过捕获系统指标之间的多变量时空关系来改进云资源分配,优先考虑服务稳定性而非预测准确性。在沃尔玛部署后,它在保持服务可靠性的同时实现了10%-50%的成本节约。

0 人收藏 0 人点赞
#autoscaling

深度强化学习何时能击败经过校准的基线?关于自适应资源控制的基准研究

arXiv cs.LG · 2026-05-27 缓存

一项基准研究发现,经过校准的基于规则的自动扩缩器在所有测试工作负载上成本均优于六种主流深度强化学习算法,而深度强化学习仅在突发流量模式中表现出更高成本下的优势。该论文提出了RLScale-Bench以改进评估协议和可复现性。

0 人收藏 0 人点赞
#autoscaling

如何在预算有限的情况下为AI Agent扩展基础设施?

Reddit r/AI_Agents · 2026-05-19

讨论了在预算有限的情况下为AI Agent管道扩展基础设施的实际挑战,强调了基于CPU/内存的自动扩展对于GPU推理工作负载的不足。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈