SECTOR 07 / KNOWLEDGE EXPEDITION

阿里云ACP大模型认证(上)

阿里云 ACP 认证考试中大模型相关的核心知识点、PAI 平台、DashScope 服务、百炼平台和模型评估体系

01

阿里云ACP认证概述

EXPLORE +
02

灵积(DashScope)模型服务

EXPLORE +

DashScope 简介

DashScope(灵积)是阿里云的一站式模型服务平台,提供统一 API 调用各类 AI 模型的能力。它是阿里云大模型服务的核心入口。

通义千问系列模型

模型特点适用场景
Qwen-Max旗舰版,最强综合能力复杂推理、高质量内容生成
Qwen-Plus增强版,性价比优秀日常开发、通用场景
Qwen-Turbo轻量版,响应速度快简单任务、高频调用
Qwen-VL-Max视觉理解版图像分析、OCR
Qwen-Long超长上下文版(10M tokens)长文档处理
Qwen-Coder代码专用版编程任务

API 调用

# DashScope API 示例
import dashscope
from dashscope import Generation

dashscope.api_key = "your-api-key"

response = Generation.call(
model="qwen-max",
prompt="解释什么是大语言模型",
temperature=0.7,
max_tokens=500
)
print(response.output.text)
03

百炼平台

EXPLORE +

百炼平台定位

百炼是阿里云的大模型应用开发平台,提供从数据准备、模型调优到应用评测的全链路 AI 开发能力。比 DashScope 更偏上层应用开发。

核心功能模块

  • 数据管理:支持上传多种格式数据(TXT/PDF/Excel),提供标注工具
  • 模型调优:支持 SFT(监督微调)和 DPO 两种微调方式
  • 模型评测:内置评测数据集,自动评分并生成报告
  • 应用部署:一键部署为 API 或在线应用
  • Prompt 管理:提示词版本管理和批量测试
  • RAG 应用:内置知识库搭建和检索增强生成能力

百炼 vs DashScope

维度百炼DashScope
定位应用开发平台模型服务 API
主要功能数据→训练→评测→部署模型推理调用
用户AI 应用开发者所有开发者
低代码是(可视化操作)否(API 调用)
04

PAI 平台全流程

EXPLORE +

PAI 平台组件

组件功能适用场景
PAI-Studio可视化建模,拖拽式 ML 流程低代码 ML 开发
PAI-DSW交互式 Notebook(Jupyter)算法探索、原型开发
PAI-DLC分布式训练集群大规模模型训练
PAI-EAS在线推理服务模型部署为 API

全流程 MLOps

1. 数据准备(PAI-Studio / DataWorks)
- 数据采集、清洗、标注
- 特征工程、数据分割

2. 模型训练(PAI-DLC)
- 配置训练任务(镜像、资源、超参)
- 分布式训练(数据并行+模型并行)
- 训练监控(Loss、GPU 利用率)

3. 模型评估(PAI 评估模块)
- 内置评测集评测
- 对比实验(A/B 测试)

4. 模型部署(PAI-EAS)
- 一键部署为在线 API
- 弹性伸缩配置
- 蓝绿部署/灰度发布
05

ACP 高频考点总结

EXPLORE +

云计算基础考点

  • ECS 实例规格族(通用型/计算型/内存型/GPU 型)及适用场景
  • OSS 存储类型(标准/低频/归档/冷归档)
  • SLB 负载均衡调度算法(轮询/最小连接数/一致性哈希)
  • VPC 网络规划(CIDR 划分、安全组规则)

AI 平台考点

  • PAI 各组件功能区分(尤其是 DSW/DLC/EAS 的定位差异)
  • 分布式训练策略(数据并行、模型并行、流水线并行)
  • 模型部署配置(实例规格、副本数、弹性伸缩策略)
  • GPU 资源管理(vGPU、MIG、资源共享)

大模型应用考点

  • Prompt 工程在百炼平台中的实现
  • RAG 架构中的向量检索配置
  • 模型微调参数对效果的影响
  • 模型评估指标含义和计算方法

安全考点

  • RAM 权限策略配置(最小权限原则)
  • 数据加密方案(KMS 密钥管理)
  • 内容安全审核策略
  • 操作审计(ActionTrail)
06

模型评估指标

EXPLORE +

分类任务指标

# 混淆矩阵
预测正类 预测负类
实际正类 TP FN
实际负类 FP TN

# 核心指标
准确率 Accuracy = (TP + TN) / (TP + TN + FP + FN)
精确率 Precision = TP / (TP + FP)
召回率 Recall = TP / (TP + FN)
F1-Score = 2 × Precision × Recall / (Precision + Recall)

生成任务指标

  • BLEU:基于 n-gram 精确度,衡量生成文本和参考文本的词汇重叠度(0-1)
  • ROUGE-L:基于最长公共子序列(LCS),衡量生成文本和参考文本的相似度
  • Perplexity:困惑度,衡量模型对文本的预测能力(越低越好)
  • LLM-as-Judge:用另一个 LLM 评估生成质量,覆盖准确性、相关性、流畅性等维度

评估方法论

  • 人工评估:最准确但成本高,适合小规模精测
  • 自动评估:使用 BLEU/ROUGE 等指标,适合大规模回归
  • 混合评估:自动指标初筛 + 人工抽样复核
  • 对抗评估:红队测试、边界测试