SECTOR 08 / KNOWLEDGE EXPEDITION

阿里云ACP大模型认证(下)

继续深入学习 ACP 考试的高级考点:模型部署优化、模型量化、RAG 架构、安全评测和企业级部署架构

01

模型部署与优化

EXPLORE +

部署架构选择

方式适用场景特点
PAI-EAS 在线推理实时 API 服务低延迟(<100ms),自动扩缩
PAI-DLC 分布式训练大规模模型训练GPU 集群调度,弹性资源
函数计算 FC + GPU轻量推理按需付费,事件驱动,冷启动
ACK 容器服务自定义部署K8s 编排,灵活度最高

推理优化技术

  • 模型量化:FP16→INT8/INT4,减少 50-75% 显存占用,推理速度提升 2-4 倍
  • KV-Cache 优化:共享前缀缓存、PagedAttention(vLLM)
  • 动态批处理:合并多个请求提高 GPU 利用率
  • 模型蒸馏:用大模型教小模型,保持 90%+ 性能但体积减少 90%
  • Tensor 并行:多 GPU 并行推理,减少单卡显存压力

弹性伸缩策略

  • 基于 QPS/CPU/GPU 利用率的自动扩容
  • GPU 资源预热(冷启动优化)
  • 预留实例 + 按量实例混合部署降成本
  • HPA(水平自动扩缩)和 VPA(垂直自动扩缩)
02

模型量化原理

EXPLORE +

为什么需要量化?

大模型通常使用 FP32(32 位浮点数)训练,每个参数占 4 字节。一个 70B 模型仅参数就需要 280GB 显存,远超单张 GPU 容量。量化通过降低数值精度来压缩模型。

量化类型

# 量化精度对比
FP32: 0 00000000 00000000000000000000000 → 4 字节/参数
FP16: 0 00000 0000000000 → 2 字节/参数
INT8: 00000000 → 1 字节/参数
INT4: 0000 → 0.5 字节/参数

# 70B 模型不同精度的显存需求
FP32: 280 GB(需要 4×A100 80G)
FP16: 140 GB(需要 2×A100 80G)
INT8: 70 GB(1×A100 80G 勉强)
INT4: 35 GB(可以在 1×A100 上运行!)

量化方法

  • PTQ(训练后量化):训练完成后直接量化,简单但有一定精度损失
  • QAT(量化感知训练):训练中模拟量化效果,精度损失更小但需要重新训练
  • GPTQ:基于最优脑外科框架的量化方法,效果好(Post-Training Quantization)
  • AWQ:激活感知权重量化,识别 1% 的关键权重并保护它们

量化公式

# 对称量化
x_int8 = round(x_float / scale)
scale = max(|x_float|) / 127

# 反量化
x_float ≈ x_int8 × scale
03

RAG 架构与向量数据库

EXPLORE +

RAG 完整流程

RAG 系统流程:
用户提问
→ 1. 向量化:将问题转为 embedding 向量
→ 2. 检索:在向量数据库中搜索最相似的文档
→ 3. 重排序:对检索结果精排
→ 4. 注入:将相关文档注入 Prompt
→ 5. 生成:LLM 基于上下文生成答案
→ 6. 溯源:附上引用来源

向量检索核心原理

# 余弦相似度
similarity(A, B) = cos(θ) = (A · B) / (||A|| × ||B||)

# 向量检索算法
- 暴力搜索(KNN):O(n×d),小数据集可用
- IVF(倒排文件):聚类+局部搜索,O(√n)
- HNSW(分层可导航小世界图):O(log n),目前最流行

阿里云向量检索产品

产品类型适用场景
DashVector专用向量数据库高性能向量检索,10ms 级延迟
Elasticsearch搜索引擎(支持向量)文本+向量混合搜索
OpenSearch智能搜索服务企业级搜索,向量+关键词融合
ADB PG分析型数据库(向量插件)SQL+向量混合查询
04

RAG 评估框架

EXPLORE +

RAG 评估维度

维度指标测量方法
检索准确率Recall@k, Precision@k, MRR标注的相关文档 vs 检索结果
生成质量Faithfulness, Answer RelevanceLLM-as-Judge 评分
端到端Context Precision, Context Recall综合评估
延迟P50/P95/P99 延迟压力测试

RAG 评估框架(RAGAS)

RAGAS 是流行的开源 RAG 评估框架,包含以下核心指标:

  • Faithfulness:生成答案是否忠实于检索上下文(无幻觉)
  • Answer Relevance:答案是否与问题相关
  • Context Precision:检索结果中相关文档的比例
  • Context Recall:所有相关文档被成功检索的比例

RAG 性能瓶颈分析

  • 检索失败:相关文档未被检索到 → 提高 chunk 重叠度、多路召回
  • 上下文过载:太多不相关内容干扰 LLM → 重排序、选择性注入
  • 幻觉:LLM 不遵循检索内容 → 强化提示词约束、降低 temperature
05

大模型安全与合规

EXPLORE +

大模型安全挑战

  • Prompt 注入:恶意提示词绕过安全限制,诱使模型执行未授权操作
  • 数据泄露:模型输出中包含训练数据中的敏感信息
  • 有害内容生成:输出违法、暴力、歧视性内容
  • 偏见与歧视:训练数据中的社会偏见被模型继承和放大

阿里云安全方案

  • 内容安全:文本/图片审核 API,检测违规内容
  • 数据加密:传输加密(TLS 1.3)、存储加密(KMS + 密钥轮换)
  • 访问控制:RAM 精细化权限管理,最小权限原则
  • 审计日志:ActionTrail 操作审计,90 天日志保留
  • WAF:Web 应用防火墙,防御注入攻击

合规要求

  • 《生成式人工智能服务管理暂行办法》——算法备案、安全评估
  • 《个人信息保护法》(PIPL)——用户数据保护
  • 等保 2.0 三级——信息安全等级保护
  • 数据分类分级管理
06

安全评测方法论

EXPLORE +

红队测试(Red Teaming)

红队测试是模拟攻击者行为对模型进行安全评估的方法,目的是在大规模部署前发现安全漏洞。

红队测试流程:
1. 威胁建模:识别可能的攻击面
- Prompt 注入、越狱、角色反转
- 数据投毒、后门触发
- 拒绝服务、资源耗尽

2. 测试用例生成
- 手工编写:领域专家设计
- 自动生成:LLM 辅助生成变体
- 对抗生成:GAN/遗传算法

3. 执行测试
- 黑盒测试:只访问 API
- 白盒测试:可访问模型权重
- 灰盒测试:部分信息

评估指标

  • ASR(Attack Success Rate):攻击成功率
  • 拒绝率:模型正确拒绝恶意请求的比例
  • 越狱韧性:模型抵抗越狱提示的能力
  • 数据泄露率:模型泄露训练数据的比例

安全评估工具

  • Garak:开源 LLM 安全评估框架
  • Azure AI Content Safety:内容安全 API
  • 阿里云内容审核:文本/图片/语音审核