Skip to content
Open
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
16 changes: 7 additions & 9 deletions 01Introduction/06Foundation.md
Original file line number Diff line number Diff line change
Expand Up @@ -12,17 +12,17 @@

从**参数规模**上看,AI 大模型先后经历了预训练模型(Pre Training)、大规模预训练模型、超大规模预训练模型三个阶段,每年网络模型的参数规模以 10 倍级以上进行提升,参数量实现了从亿级到百万亿级的突破。截止到 2024 年为止,千亿级参数规模的大模型成为主流。

[大模型发展趋势](images/05Foundation01.png)
![大模型发展趋势](images/05Foundation01.png)

从**技术架构**上看,如图所示 Transformer 架构是当前大模型领域主流的算法架构基础,由此形成了 GPT 和 BERT 两条主要的技术路线,其中 BERT 最有名的落地课程是谷歌的 AlphaGo。在 GPT3.0 发布后,GPT 逐渐成为大模型的主流路线。综合来看,当前几乎所有参数规模超过千亿的大型语言模型都采取 GPT 模式,如国外有 Grok、Gaulde,国内有百度文心一言,阿里发布的通义千问等。

[Bert and GPT](images/05Foundation02.png)
![Bert and GPT](images/05Foundation02.png)

从大模型的**支持模态**上看,AI 大模型可分为大语言模型(Large Language Model,缩写 LLM),视觉大模型(Large Vision Model,缩写 LVM)、多模态大模型(Large Multimodal Model,缩写 LMM)、图网络大模型(Large Graph Model,缩写 GLM)、科学计算大模型(Large Science Model,缩写 LSM)等。AI 大模型支持的模态呈现丰富化发展、更加多样,从支持文本、图片、图像、语音单一模态下的单一任务,逐渐发展为文生图、文生视频、图解析文字等支持混合多种模态下的多种任务。

从应用领域上看,大模型可分为 L0、L1、L2 三层。其中 L0 层面是通用基础大模型,涉及到 LLM、LVM、LMM、GLM 等等,通用大模型是具有强大泛化能力,可在不进行微调或少量微调的情况下完成多场景任务,相当于 AI 完成了“通识教育”,ChatGPT、华为盘古都是通用大模型;L1 是构建在 L0 基础上面向行业进行训练的行业大模型(包含政务、金融、制造、矿山、铁路等行业),行业大模型利用行业知识对大模型进行微调,让 AI 完成“专业教育”,以满足在能源、金融、制造、传媒等不同领域的具体需求,如金融领域的 BloombergGPT、航天-百度文心等;而 L2 层则是面是面向一些具体细分行业,通过工作流等从 L1 行业大模型中抽取的符合场景需求,进行针对具体的行业数据机型微调后,使模型处于更加细分领域的场景中应用。

[Bert and GPT](images/05Foundation03.png)
![Bert and GPT](images/05Foundation03.png)

当前,AI 大模型的发展正从以不同模态数据为基础过渡到与知识、可解释性、学习理论等方面相结合,呈现出全面发力、多点开花的新格局。

Expand Down Expand Up @@ -60,7 +60,7 @@ AI 大模型发展历经三个阶段,分别是萌芽期、探索期和爆发

大模型进入了爆发期后,在 LLM 进化树中,BERT(Encoder-Only)、T5(Encoder-Decoder)、GPT(Decoder-Only)分别代表了不同的架构方向。那为什么在大模型时代,曾经风光无限的 BERT 家族和 T5 家族会逐渐没落了?

[大模型家族树](images/05Foundation04.png)
![大模型家族树](images/05Foundation04.png)

从纯算法模型结构上,谷歌的 T5 是比 GPT 更加优雅的神经网络模型结构,但是由于 T5 的模型结构不是线性的,因为在 Decoder 和 Encoder 之间有复杂的连接关系(即对应的 Cross Attention 或者叫做 Cross Condition),导致 T5 在真正大规模堆叠的时候,实际上在工程领域,很难通过分布式并行高效的执行起来。因此,在目前已知的分布式并行优化上,T5 很难通过规模化扩展模型的规模,Scale 到千亿参数以上。

Expand Down Expand Up @@ -101,13 +101,13 @@ AI 系统对于新算法研究的重要性日益凸显,如今已不仅仅是

- AI System(AI 系统)是 AI 时代连接硬件和上层应用的中间层基础设施。主要包含底层系统架构、编译器、AI 框架等**纵向**的基础软硬件设施。

[](images/05Foundation05.png)
![](images/05Foundation05.png)

### AI Infra(AI 基础设施)

大模型时代对 AI 基础设施的需求,与传统机器学习时代的工具栈侧重点有所不同。AI Infra 主要是从 AI 训练模型、构建 AI 赋能应用的工作流视角出发,更加关注 AI 在大模型开发、训练和推理部署的相关环节,即从 AI 训练和推理的环节过程作为代表,历经从数据准备、模型训练、模型部署、产品整合等不同环节。因此更强调的是从大模型数据准备到训练、推理、应用横向的软硬件基础设施。

[](images/05Foundation06.png)
![](images/05Foundation06.png)

#### 数据准备

Expand Down Expand Up @@ -173,9 +173,7 @@ AI 系统对于新算法研究的重要性日益凸显,如今已不仅仅是

稳定性/成本:集群容错是一个 2023 年比较热门的话题,也是大型企业造大模型时的真实需求。同时还有一个高度关联的方向,弹性计算,也得到了广泛的关注。早期工作包括 Varuna [EuroSys'22](Best Paper)和 Bamboo [NSDI'23],今年也出现了一些 Competitors,比如 Gemini [SOSP'23], Parcae [NSDI'24]和 Oobleck [SOSP'23]。这些方向 2024 年可能会得到更多关注。

推理

效率:incremental decoding 改变了 LLM 中的部分算子实现机制,但经过 23 年一整年的 Kernel 优化,硬件性能也几乎已经压榨到极限(主要指访存带宽)。展望 2024,在系统效率,尤其是 end-to-end inference latency 这一单一指标上,能比现在 SOTA 方案做的多好其实是要画问号的。一个可能的方向是 speculative decoding;另外如果是围绕其他性能指标如 throughput 和 TTFT/TPOT 展开优化,应该也还有一些可做的空间;如果是能够再牺牲“亿”点点模型效果,不保证输出内容严格对齐的话,那可做的事情就更多了。这部分详细内容可以参考综述论文:Hsword:大模型如何高效部署?CMU 最新万字综述纵览 LLM 推理 MLSys 优化技术
推理效率:incremental decoding 改变了 LLM 中的部分算子实现机制,但经过 23 年一整年的 Kernel 优化,硬件性能也几乎已经压榨到极限(主要指访存带宽)。展望 2024,在系统效率,尤其是 end-to-end inference latency 这一单一指标上,能比现在 SOTA 方案做的多好其实是要画问号的。一个可能的方向是 speculative decoding;另外如果是围绕其他性能指标如 throughput 和 TTFT/TPOT 展开优化,应该也还有一些可做的空间;如果是能够再牺牲“亿”点点模型效果,不保证输出内容严格对齐的话,那可做的事情就更多了。这部分详细内容可以参考综述论文:Hsword:大模型如何高效部署?CMU 最新万字综述纵览 LLM 推理 MLSys 优化技术

易用性:自动并行在推理侧看起来没有太多有趣的东西,主流框架已经可以把各种并行策略(如 TP/PP)支持的很好了。个人感觉,随着大模型使用场景的复杂性逐渐增加,未来更值得关注的可能是如何把推理引擎更好地和整套 AI Service 产品 Pipeline 相结合,提高整体的部署和服务效率。

Expand Down