01
SECTOR 07 / KNOWLEDGE EXPEDITION
阿里云ACP大模型认证(上)
阿里云 ACP 认证考试中大模型相关的核心知识点、PAI 平台、DashScope 服务、百炼平台和模型评估体系
02
灵积(DashScope)模型服务
EXPLORE +
DashScope 简介
DashScope(灵积)是阿里云的一站式模型服务平台,提供统一 API 调用各类 AI 模型的能力。它是阿里云大模型服务的核心入口。
通义千问系列模型
| 模型 | 特点 | 适用场景 |
|---|---|---|
| Qwen-Max | 旗舰版,最强综合能力 | 复杂推理、高质量内容生成 |
| Qwen-Plus | 增强版,性价比优秀 | 日常开发、通用场景 |
| Qwen-Turbo | 轻量版,响应速度快 | 简单任务、高频调用 |
| Qwen-VL-Max | 视觉理解版 | 图像分析、OCR |
| Qwen-Long | 超长上下文版(10M tokens) | 长文档处理 |
| Qwen-Coder | 代码专用版 | 编程任务 |
API 调用
# DashScope API 示例
import dashscope
from dashscope import Generation
dashscope.api_key = "your-api-key"
response = Generation.call(
model="qwen-max",
prompt="解释什么是大语言模型",
temperature=0.7,
max_tokens=500
)
print(response.output.text)03
百炼平台
EXPLORE +
百炼平台定位
百炼是阿里云的大模型应用开发平台,提供从数据准备、模型调优到应用评测的全链路 AI 开发能力。比 DashScope 更偏上层应用开发。
核心功能模块
- 数据管理:支持上传多种格式数据(TXT/PDF/Excel),提供标注工具
- 模型调优:支持 SFT(监督微调)和 DPO 两种微调方式
- 模型评测:内置评测数据集,自动评分并生成报告
- 应用部署:一键部署为 API 或在线应用
- Prompt 管理:提示词版本管理和批量测试
- RAG 应用:内置知识库搭建和检索增强生成能力
百炼 vs DashScope
| 维度 | 百炼 | DashScope |
|---|---|---|
| 定位 | 应用开发平台 | 模型服务 API |
| 主要功能 | 数据→训练→评测→部署 | 模型推理调用 |
| 用户 | AI 应用开发者 | 所有开发者 |
| 低代码 | 是(可视化操作) | 否(API 调用) |
04
PAI 平台全流程
EXPLORE +
PAI 平台组件
| 组件 | 功能 | 适用场景 |
|---|---|---|
| PAI-Studio | 可视化建模,拖拽式 ML 流程 | 低代码 ML 开发 |
| PAI-DSW | 交互式 Notebook(Jupyter) | 算法探索、原型开发 |
| PAI-DLC | 分布式训练集群 | 大规模模型训练 |
| PAI-EAS | 在线推理服务 | 模型部署为 API |
全流程 MLOps
1. 数据准备(PAI-Studio / DataWorks)
- 数据采集、清洗、标注
- 特征工程、数据分割
2. 模型训练(PAI-DLC)
- 配置训练任务(镜像、资源、超参)
- 分布式训练(数据并行+模型并行)
- 训练监控(Loss、GPU 利用率)
3. 模型评估(PAI 评估模块)
- 内置评测集评测
- 对比实验(A/B 测试)
4. 模型部署(PAI-EAS)
- 一键部署为在线 API
- 弹性伸缩配置
- 蓝绿部署/灰度发布05
ACP 高频考点总结
EXPLORE +
云计算基础考点
- ECS 实例规格族(通用型/计算型/内存型/GPU 型)及适用场景
- OSS 存储类型(标准/低频/归档/冷归档)
- SLB 负载均衡调度算法(轮询/最小连接数/一致性哈希)
- VPC 网络规划(CIDR 划分、安全组规则)
AI 平台考点
- PAI 各组件功能区分(尤其是 DSW/DLC/EAS 的定位差异)
- 分布式训练策略(数据并行、模型并行、流水线并行)
- 模型部署配置(实例规格、副本数、弹性伸缩策略)
- GPU 资源管理(vGPU、MIG、资源共享)
大模型应用考点
- Prompt 工程在百炼平台中的实现
- RAG 架构中的向量检索配置
- 模型微调参数对效果的影响
- 模型评估指标含义和计算方法
安全考点
- RAM 权限策略配置(最小权限原则)
- 数据加密方案(KMS 密钥管理)
- 内容安全审核策略
- 操作审计(ActionTrail)
06
模型评估指标
EXPLORE +
分类任务指标
# 混淆矩阵
预测正类 预测负类
实际正类 TP FN
实际负类 FP TN
# 核心指标
准确率 Accuracy = (TP + TN) / (TP + TN + FP + FN)
精确率 Precision = TP / (TP + FP)
召回率 Recall = TP / (TP + FN)
F1-Score = 2 × Precision × Recall / (Precision + Recall)生成任务指标
- BLEU:基于 n-gram 精确度,衡量生成文本和参考文本的词汇重叠度(0-1)
- ROUGE-L:基于最长公共子序列(LCS),衡量生成文本和参考文本的相似度
- Perplexity:困惑度,衡量模型对文本的预测能力(越低越好)
- LLM-as-Judge:用另一个 LLM 评估生成质量,覆盖准确性、相关性、流畅性等维度
评估方法论
- 人工评估:最准确但成本高,适合小规模精测
- 自动评估:使用 BLEU/ROUGE 等指标,适合大规模回归
- 混合评估:自动指标初筛 + 人工抽样复核
- 对抗评估:红队测试、边界测试