About

I am a Technical Support Engineer based in mainland China, dedicated to helping users and teams efficiently resolve complex technical issues.

Read more

Rancher 收集 Profile 文件

Rancher 通过匿名导入 Go 标准库 net/http/pprof,并使用默认 HTTP mux 监听 127.0.0.1:6060

Profile 文件可用于性能分析。当 Rancher 出现性能问题时,例如 CPU 使用率异常高、内存持续上涨、Goroutine 数量异常增加等,可以通过以下方式收集 Profile 文件进行分析。

Read more

AI 中的 Token

Token 是大语言模型处理文本时使用的基本单位。它不一定等于一个字、一个词或一个字符,而是由模型的分词器决定。

Read more

vLLM 使用实践

本文记录在 RTX 3060 12 GiB 上部署和调优 vLLM 的过程,包括 Python 与 Docker 启动方式、请求级采样参数、服务级显存与并发配置,以及通过 HAMi 在 Kubernetes 中共享单张 GPU。本文参数以功能验证和调优起点为主,不代表所有模型和负载下的最佳配置。

Read more

HAMi + Volcano 的 vGPU 使用实践

HAMi 是一个用于管理 Kubernetes 集群中异构 AI 计算设备的开源平台。其前身为 k8s-vGPU-scheduler,可在多个容器和工作负载之间实现设备共享。

Volcano 是基于 Kubernetes 的容器批量计算平台,主要用于高性能计算场景。

本文结合两者的能力进行实践,参考资料:https://project-hami.io/zh/tutorials/labs/volcano-vgpu-gang-queue

Read more