Kubernetes In Anger
摘要
一份全面指南,介绍在生产环境中调试和管理 Amazon EKS 集群,重点关注常见故障模式、事件响应和安全升级。涵盖 EKS 与标准 Kubernetes 的关键差异。
查看缓存全文
缓存时间: 2026/05/21 12:14
相似文章
@jaga_prasanna: https://x.com/jaga_prasanna/status/2079614504451838426
一个教育性的推文串,使用像亚马逊仓库和巡航控制这样易于理解的类比来解释Kubernetes的核心概念,分解了组件和期望状态机制。
@alexa_griffith_: Red Hat AI博客系列第三部分现已发布!本部分重点介绍Red Hat的托管Kubernetes AI推理如何使用llm-d...
Red Hat的AI博客系列第三部分详细介绍了在他们的托管Kubernetes平台(Amazon EKS)中,llm-d如何利用Kubernetes资源和Envoy集成来路由模型推理流量,并做出实时决策。
Kubernetes探针的工作原理
本文解释了Kubernetes探针(包括启动探针、就绪探针和存活探针)如何协同工作以提升应用程序的弹性,并通过交互式演示展示其功能。
Kubernetes 扩展到 7,500 个节点
# Kubernetes 扩展到 7,500 个节点 来源:[https://openai.com/index/scaling-kubernetes-to-7500-nodes/](https://openai.com/index/scaling-kubernetes-to-7500-nodes/) OpenAI将单个 Kubernetes 集群扩展到这个规模很少见,需要特殊的关注,但好处是提供了一个简单的基础设施,让我们的机器学习研究团队能够更快地迭代并扩展,而无需改变代码。从我们之前关于[扩展到 2,500 个节点](https://openai.com/index/scaling-kube)的文章以来
将 Kubernetes 扩展到 2,500 个节点
OpenAI 分享了将 Kubernetes 扩展到 2,500 个节点的基础设施经验教训,详细介绍了容器镜像拉取的优化方案,包括 kubelet 配置更改、Docker overlay2 迁移和预加载策略,以解决 Pending pod 的问题。