Rancher Elemental Bare Metal 网络接口名称变更问题
环境中的 Bare Metal 节点通过 ifnames=1 开启了网络接口命名预测,但在进行 OS 升级后,接口名称由 ens* 变成了 enp*,导致原有的 bond 配置无法生效,网络中断。
Rancher Elemental Bare Metal 网络接口名称变更问题
环境中的 Bare Metal 节点通过 ifnames=1 开启了网络接口命名预测,但在进行 OS 升级后,接口名称由 ens* 变成了 enp*,导致原有的 bond 配置无法生效,网络中断。
通过 ManagedOSImage 升级 Rancher Elemental 节点
ManagedOSImage 资源用于定义需要应用到一组目标集群中各节点的操作系统镜像或镜像版本。
可以使用其来对 Elemental 节点进行 OS 升级,以及升级过程中新配置的下发。
VMware 使用 Rancher Elemental RAW 介质
Rancher Elemental 支持构建 ISO 和 RAW 两种类型的介质。本文测试在 VMware 环境中使用 RAW 介质。
Rancher Monitoring Node Exporter with Kube RBAC Proxy
通过 Rancher Monitoring 部署的 Node Exporter,默认会监听节点的 9796 端口。
通常情况下,任何能够访问节点 9796 端口的客户端,都可能读取 Node Exporter 暴露的指标数据,这在很多环境中不符合安全要求。
可以通过启用 Kube RBAC Proxy,将 Node Exporter 收口到 127.0.0.1:8100,对外的 9796 端口使用 HTTPS,并通过 Kubernetes TokenReview 和 SubjectAccessReview 进行身份验证与 RBAC 授权。
Rancher 通过匿名导入 Go 标准库 net/http/pprof,并使用默认 HTTP mux 监听 127.0.0.1:6060。
Profile 文件可用于性能分析。当 Rancher 出现性能问题时,例如 CPU 使用率异常高、内存持续上涨、Goroutine 数量异常增加等,可以通过以下方式收集 Profile 文件进行分析。
RKE/RKE2 节点配置 NVIDIA Container Runtime
Read more基于 RKE2 与 NVIDIA Tesla P4 的 HAMi 使用实践
HAMi 是一个用于管理 Kubernetes 集群中异构 AI 计算设备的开源平台。其前身为 k8s-vGPU-scheduler,可在多个容器和工作负载之间实现设备共享。
本文基于 RKE2 和 NVIDIA Tesla P4 进行测试,同时使用 GPU Operator 在 GPU 节点上自动安装驱动和 NVIDIA Container Toolkit。
RKE2 通过 fake-gpu-operator 使用 HAMi
fake-gpu-operator 可以在 CPU 节点上模拟 nvidia.com/gpu 资源。在没有真实 GPU 的情况下,可以用于了解 HAMi 组件组成,并验证 GPU Pod 的调度流程。
参考资料:https://project-hami.io/zh/tutorials/labs/local-fake-gpu
通过 Rancher 创建的 RKE2 和 K3s 集群支持开启 Authorized Cluster Endpoint(ACE)。
开启 ACE 后,用户可以通过集群 API Server 的 FQDN 直接访问下游集群,而无需经过 Rancher 代理转发。
Rancher Monitoring Pushprox 端口监听问题
Rancher Monitoring 会通过 PushProx 获取 kube-controller-manager、kube-scheduler 等 Kubernetes 组件的 Metrics。
其中,9369 端口是 pushprox-client 在启用 hostNetwork 后默认监听的 Metrics 端口。默认情况下,可以通过节点 IP 和该端口访问 PushProx 的 Metrics。