Token 是大语言模型处理文本时使用的基本单位。它不一定等于一个字、一个词或一个字符,而是由模型的分词器决定。
Token 是大语言模型处理文本时使用的基本单位。它不一定等于一个字、一个词或一个字符,而是由模型的分词器决定。
本文记录在 RTX 3060 12 GiB 上部署和调优 vLLM 的过程,包括 Python 与 Docker 启动方式、请求级采样参数、服务级显存与并发配置,以及通过 HAMi 在 Kubernetes 中共享单张 GPU。本文参数以功能验证和调优起点为主,不代表所有模型和负载下的最佳配置。
HAMi 是一个用于管理 Kubernetes 集群中异构 AI 计算设备的开源平台。其前身为 k8s-vGPU-scheduler,可在多个容器和工作负载之间实现设备共享。
Volcano 是基于 Kubernetes 的容器批量计算平台,主要用于高性能计算场景。
本文结合两者的能力进行实践,参考资料:https://project-hami.io/zh/tutorials/labs/volcano-vgpu-gang-queue
RKE/RKE2 节点配置 NVIDIA Container Runtime
Read moreNVIDIA GeForce RTX 3060 内核驱动安装
NVIDIA 提供了多种驱动安装方式,此处记录 NVIDIA GeForce RTX 3060 驱动的安装方法。
以下安装方式任选其一,不要混合使用。切换安装方式前,需要先卸载通过其他方式安装的 NVIDIA 驱动。