01
模型部署与优化
EXPLORE +
部署架构选择
| 方式 | 适用场景 | 特点 |
|---|---|---|
| PAI-EAS 在线推理 | 实时 API 服务 | 低延迟(<100ms),自动扩缩 |
| PAI-DLC 分布式训练 | 大规模模型训练 | GPU 集群调度,弹性资源 |
| 函数计算 FC + GPU | 轻量推理 | 按需付费,事件驱动,冷启动 |
| ACK 容器服务 | 自定义部署 | K8s 编排,灵活度最高 |
推理优化技术
- 模型量化:FP16→INT8/INT4,减少 50-75% 显存占用,推理速度提升 2-4 倍
- KV-Cache 优化:共享前缀缓存、PagedAttention(vLLM)
- 动态批处理:合并多个请求提高 GPU 利用率
- 模型蒸馏:用大模型教小模型,保持 90%+ 性能但体积减少 90%
- Tensor 并行:多 GPU 并行推理,减少单卡显存压力
弹性伸缩策略
- 基于 QPS/CPU/GPU 利用率的自动扩容
- GPU 资源预热(冷启动优化)
- 预留实例 + 按量实例混合部署降成本
- HPA(水平自动扩缩)和 VPA(垂直自动扩缩)