《入门大语言模型(LLM)开发及部署》
讲师:王明哲 发布日期:07-20 浏览量:28
《入门大语言模型(LLM)开发及部署》
主讲:王明哲
【课程背景】LLM是新一代的生产力工具,如何将其与自身业务结合是未来所有企业的必答题。但是LLM是一个典型的易于上手,难于精通的工具,究竟如何该让其为自身企业产生价值一直是困扰很多行业的难题。
另外,由于数据保密问题,很少有企业可以直接将自身核心数据共享给互联网上的LLM工具,如何在企业内网私有化部署LLM,我们该选择什么样的LLM,如何让私有化部署的LLM在企业场景提升效果等等关键问题将在课上解答。
【课程收益】
LLM的基础原理
如何部署LLM
如何微调LLM
如何将LLM落地应用
国内外主流LLM之间的差异对比
【课程特色】
够专业,内容前沿且正确;讲俗话,将复杂技术具象清晰有趣化;重互动,巧妙设计提升参与感;能落地,反复验证的方法及真实案例。
【课程时间】
1-2天(6小时/天)
【课程大纲】
一、机器学习快速入门
1、机器学习简介
机器学习核心原理
机器学习=数学+编程
案例带入-预测男生是否受欢迎
2、数据的矩阵化表示
什么是数据矩阵化
编码实现数据矩阵化
3、数据的归一化和可视化
归一化原理
编码实现归一化
编码实现数据可视化
4、线性模型及矩阵运算
什么是线性模型
编程实现矩阵运算
5、激活函数
SIGMOD激活函数介绍
编程实现SIGMOD函数
6、损失函数
交叉熵损失函数介绍
编程实现交叉熵损失函数
7、梯度下降法
梯度下降法介绍
编程实现梯度下降法
8、训练集总结
训练过程串讲
完成训练并与模型一起玩一玩
二、深度学习快速入门
1、神经网络入门
什么是神经网络
神经网络的前馈过程
神经网络的反向传播
神经网络一统江湖的必然性
用神经网络完成手写字体识别任务
2、深度神经网络入门
深度学习与大数据
神经网络的前馈过程
什么是梯度消失
如何解决梯度消失
什么是梯度爆炸
如何解决梯度爆炸
大数据增强方法
mini-batch训练方法
lr-decay技巧
如何解决过拟合问题
三、深度学习编程实战
1、深度学习框架
TensorFlow串讲
Pytorch框架串讲
百度飞桨框架串讲
2、利用深度学习框架编程
确认问题的价值
进行初步的机理分析
找到关联性的数据
构造有代表性的数据集
完成数据预处理及标注
完成特征工程
选定模型并训练
业务专家与算法工程师配合迭代
案例:设备预测性维护
四、大语言模型(LLM)入门
1、Transformer原理
Transformer背景解析
单词Embedding
位置Embedding
Self-Attention 结构讲解
Q, K, V 矩阵计算
Self-Attention 的输出
Multi-Head Attention的组成
Encoder 结构解析
Decoder 结构解析
Transformer原理总结
2、分布式框架选择
英伟达Megatron-LM框架
Hugging Face Accelerate -基于Pytorch框架
HF Transformers的Trainer API-基于Pytorch框架
3、环境配置
安装pytorch、cuda、nccl、NVIDIA APEX 和 nltk 库
或者从NGC拉取附带所有所需环境的NVIDIA PyTorch容器
安装docker运行容器并克隆Megatron-LM库
添加分词器的词汇文件 vocab.json 和合并表 merges.txt
4、数据预处理
将预训练数据转为jason格式
将数据 tokenize、shuffle 并处理成二进制格式
设置workers 和 chunk_size 选项,确定训练使用的线程数量和分配给每个线程的数据块大小设置dataset-impl,制定索引数据集的实现方式
5、分布式训练
设置分布式资源参数:GPU数量,Master地址,Master端口等
设置模型训练超参:lr,train-iters,lr-decay-iters,lr-decay-style,lr-warmup-iters,weight-decay,adam-beta等等
6、模型评价及迭代
常规评估:eval losses,TokenClassificationPipeline
知识能力评估:中文知识能力测试数据集C-Eval
7、模型部署与推理
部署硬件讲解
模型量化及瘦身
部署到指定GPU
前段调用,完成推理