本地部署

vLLM 生产栈 Kubernetes 部署:2026 全流程清单(并发、显存、监控)

用 Helm + vLLM Production Stack 在 K8s 上跑多模型服务,含路由、负载、实时监控,适合中小团队 70B 级本地部署。

本文は SEO 深度のため主に中国語です。上記は要点のローカライズ。言語切替と深リンクで国際ナビできます。

# vLLM 生产栈 Kubernetes 部署:2026 全流程清单(并发、显存、监控)\n\n这是 2026 年适合中小团队的 vLLM 生产栈 Kubernetes 完整部署指南。使用 Helm + vLLM Production Stack 在 K8s 上跑多模型服务,含路由、负载、实时监控。特别适合本地部署实验和 xAI Grok 中转服务,硬件利用率轻松拉到 85%+,让你的 GrokCode 本地部署实验室成为护城河核心工具。\n\n中小团队无需云服务,直接在自家 GPU 集群上跑 70B 级本地部署,TCO 控制在可控范围,适合 API 中转和模型天梯测试。\n\n## 1. vLLM Production Stack 核心架构与优势\n\nvLLM Production Stack 是官方生产级参考实现,基于 Helm 部署在 Kubernetes 上。它包含路由、负载均衡和观测组件,天然支持多模型。\n\n核心架构:\n- Serving Engine:每个模型独立 Deployment(vLLM 容器)。\n- Router:共享的请求路由器,支持模型别名、Session-ID 路由和前缀缓存。\n- Observability:内置 Prometheus + Grafana 指标。\n\n优势:\n- KV 缓存共享和前缀缓存带来 2-5 倍吞吐提升。\n- 支持 KV offloading(LMCache)。\n- 监控原生集成,生产可立即使用。\n- 完美匹配 GrokCode “本地部署实验室”定位,工程可核验。\n\n## 2. 环境准备:Kubernetes + Helm + GPU 节点\n\n1. 集群已安装 NVIDIA GPU Operator(nvidia.com/gpu 资源)。\n2. Helm 3.x:helm repo add vllm https://vllm-project.github.io/production-stack。\n3. Hugging Face Token Secret(HF_TOKEN)。\n4. 推荐 GPU 节点:A100/H100(单卡或多卡)。\n\n## 3. 部署最小化配置(1 卡 70B 模型)\n\n``yaml\nservingEngineSpec:\n modelSpec:\n - name: "llama70b"\n repository: "vllm/vllm-openai"\n tag: "latest"\n modelURL: "meta-llama/Meta-Llama-3.1-70B-Instruct"\n replicaCount: 1\n requestCPU: 10\n requestMemory: "32Gi"\n requestGPU: 1\n pvcStorage: "100Gi" # 模型缓存\n vllmConfig:\n gpu_memory_utilization: 0.85\n max_model_len: 8192\n enable_prefix_caching: true\n kv_cache_dtypes: ["fp8_e5m2"] # 显存优化\n hf_token: "<YOUR_HF_TOKEN>"\n`\n\n部署命令:\n`bash\nhelm install vllm vllm/vllm-stack -f values.yaml --namespace grokcode\n`\n\n验证:kubectl get pods -n grokcode 显示 Router + Llama70b Deployment 均 Running。\n\n## 4. 多模型路由与负载均衡设置\n\n启用多个模型(示例 values-04-multiple-models.yaml):\n\n`yaml\nservingEngineSpec:\n modelSpec:\n - name: "llama70b"\n ...\n - name: "qwen70b"\n ...\n`\n\nRouter 默认使用 Kubernetes 服务发现 + Session-ID 路由,实现负载均衡和缓存复用。\n\n暴露服务:\n`yaml\nkubectl expose deployment vllm-router --type=ClusterIP --port=8000\n`\n\n测试多模型路由:任意模型请求自动分配到对应后端。\n\n## 5. 显存管理、量化与并发参数调优\n\n| 参数 | 默认值 | 推荐值(70B 单卡) | 效果 |\n|-----------------------|--------|---------------------|------|\n| gpu_memory_utilization | 0.90 | 0.85 | 留出 KV 缓存空间,避免 OOM |\n| max_model_len | 4096 | 8192 | 平衡显存与上下文 |\n| max_num_segs | 256 | 128-512 | 并发序列上限 |\n| max_num_batched_tokens| auto | 8192 | 每批 token 预算 |\n| enable_prefix_caching | false | true | 提升相同前缀命中率 |\n| kv_cache_dtypes | auto | fp8_e5m2 | 显存减半,吞吐提升 50%+ |\n\n量化建议:AWQ/GPTQ 4-bit 模型 + FP8 KV cache,显存利用率可达 85%+。\n\n## 6. 监控仪表盘搭建与性能基准测试\n\nvLLM Production Stack 内置 kube-prometheus-stack + Grafana。\n\n访问:kubectl port-forward svc/kube-prom-stack-grafana 3000:80(默认 admin/prom-operator)。\n\n**核心指标监控**:\n- GPU 利用率 & KV 缓存占用\n- TTFT(Time To First Token)\n- QPS & 队列深度\n- 端到端延迟\n\n基准测试脚本(OpenAI 兼容端点):\n`bash\nab -n 1000 -c 50 http://<router-ip>/v1/chat/completions\n`\n\n推荐基准:单卡 70B 模型,吞吐 20-40 tok/s,p95 TTFT < 500ms。\n\n## 7. 生产环境安全加固与故障演练\n\n**安全加固**:\n- 非 root 用户 + 只读 rootfs。\n- NetworkPolicy 限制 Pod-to-Pod 流量。\n- API Key 认证 + Rate Limit。\n- 暴露端口只允许信任 IP。\n\n**故障演练**:\n- 模拟 GPU 故障:Pod 自动重启,Router 切换后端。\n- 负载突增:HPA(KEDA)基于队列深度自动扩容。\n- 滚动更新:vLLM 支持 rolling update,零中断服务。\n\n## 8. 常见坑避开与 TCO 优化建议\n\n**常见坑**:\n- 冷启动慢(模型下载):使用 PVC 缓存模型。\n- OOM:严格控制 gpu_memory_utilization + 预留 CUDA 图形空间。\n- 显存碎片:单卡 70B 推荐 1 卡部署,避免跨卡开销。\n\n**TCO 优化**:\n- 监控驱动:仅保留高峰期卡。\n- KV offloading + FP8 KV:显存节省 50%,成本降低 30%。\n- 长期:自动化脚本 + Cost Explorer 监控。\n\n**风险与边界** \n本文内容基于 vLLM 官方文档与 2026 年生产实践,仅供技术参考,不构成任何投资、法律或财务建议。实际部署请在测试环境验证,风险由用户自行承担。GrokCode 实验室不承担由此产生的任何直接或间接损失。\n\n## 延伸阅读\n- [API 中转](/api-transit)\n- [本地部署](/tools/local-deploy)\n- [模型天梯](/ladder)\n- [API 实验室](/api-lab)\n\n## English summary\nThis 2026 full-stack guide deploys vLLM Production Stack on Kubernetes for multi-model serving. Use Helm for easy setup with built-in router, load balancing, and Prometheus/Grafana monitoring. Ideal for small teams running 70B+ local models. Start with minimal 1-GPU config, then add routing and tuning. Key: optimize gpu_memory_utilization` to 0.85+, enable prefix caching, and monitor KV cache usage. Security includes NetworkPolicy and API keys. Achieves 85%+ hardware utilization for xAI Grok proxy services. All steps are verifiable in a local lab environment.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。