From 4ce50f9f80313516ed88841e82b1117332b69537 Mon Sep 17 00:00:00 2001 From: zsheli Date: Wed, 17 Dec 2025 12:01:22 +0800 Subject: [PATCH 1/2] revise pic --- 01Introduction/06Foundation.md | 12 ++++++------ 1 file changed, 6 insertions(+), 6 deletions(-) diff --git a/01Introduction/06Foundation.md b/01Introduction/06Foundation.md index 899a783e..39eafcef 100644 --- a/01Introduction/06Foundation.md +++ b/01Introduction/06Foundation.md @@ -12,17 +12,17 @@ 从**参数规模**上看,AI 大模型先后经历了预训练模型(Pre Training)、大规模预训练模型、超大规模预训练模型三个阶段,每年网络模型的参数规模以 10 倍级以上进行提升,参数量实现了从亿级到百万亿级的突破。截止到 2024 年为止,千亿级参数规模的大模型成为主流。 -[大模型发展趋势](images/05Foundation01.png) +![大模型发展趋势](images/05Foundation01.png) 从**技术架构**上看,如图所示 Transformer 架构是当前大模型领域主流的算法架构基础,由此形成了 GPT 和 BERT 两条主要的技术路线,其中 BERT 最有名的落地课程是谷歌的 AlphaGo。在 GPT3.0 发布后,GPT 逐渐成为大模型的主流路线。综合来看,当前几乎所有参数规模超过千亿的大型语言模型都采取 GPT 模式,如国外有 Grok、Gaulde,国内有百度文心一言,阿里发布的通义千问等。 -[Bert and GPT](images/05Foundation02.png) +![Bert and GPT](images/05Foundation02.png) 从大模型的**支持模态**上看,AI 大模型可分为大语言模型(Large Language Model,缩写 LLM),视觉大模型(Large Vision Model,缩写 LVM)、多模态大模型(Large Multimodal Model,缩写 LMM)、图网络大模型(Large Graph Model,缩写 GLM)、科学计算大模型(Large Science Model,缩写 LSM)等。AI 大模型支持的模态呈现丰富化发展、更加多样,从支持文本、图片、图像、语音单一模态下的单一任务,逐渐发展为文生图、文生视频、图解析文字等支持混合多种模态下的多种任务。 从应用领域上看,大模型可分为 L0、L1、L2 三层。其中 L0 层面是通用基础大模型,涉及到 LLM、LVM、LMM、GLM 等等,通用大模型是具有强大泛化能力,可在不进行微调或少量微调的情况下完成多场景任务,相当于 AI 完成了“通识教育”,ChatGPT、华为盘古都是通用大模型;L1 是构建在 L0 基础上面向行业进行训练的行业大模型(包含政务、金融、制造、矿山、铁路等行业),行业大模型利用行业知识对大模型进行微调,让 AI 完成“专业教育”,以满足在能源、金融、制造、传媒等不同领域的具体需求,如金融领域的 BloombergGPT、航天-百度文心等;而 L2 层则是面是面向一些具体细分行业,通过工作流等从 L1 行业大模型中抽取的符合场景需求,进行针对具体的行业数据机型微调后,使模型处于更加细分领域的场景中应用。 -[Bert and GPT](images/05Foundation03.png) +![Bert and GPT](images/05Foundation03.png) 当前,AI 大模型的发展正从以不同模态数据为基础过渡到与知识、可解释性、学习理论等方面相结合,呈现出全面发力、多点开花的新格局。 @@ -60,7 +60,7 @@ AI 大模型发展历经三个阶段,分别是萌芽期、探索期和爆发 大模型进入了爆发期后,在 LLM 进化树中,BERT(Encoder-Only)、T5(Encoder-Decoder)、GPT(Decoder-Only)分别代表了不同的架构方向。那为什么在大模型时代,曾经风光无限的 BERT 家族和 T5 家族会逐渐没落了? -[大模型家族树](images/05Foundation04.png) +![大模型家族树](images/05Foundation04.png) 从纯算法模型结构上,谷歌的 T5 是比 GPT 更加优雅的神经网络模型结构,但是由于 T5 的模型结构不是线性的,因为在 Decoder 和 Encoder 之间有复杂的连接关系(即对应的 Cross Attention 或者叫做 Cross Condition),导致 T5 在真正大规模堆叠的时候,实际上在工程领域,很难通过分布式并行高效的执行起来。因此,在目前已知的分布式并行优化上,T5 很难通过规模化扩展模型的规模,Scale 到千亿参数以上。 @@ -101,13 +101,13 @@ AI 系统对于新算法研究的重要性日益凸显,如今已不仅仅是 - AI System(AI 系统)是 AI 时代连接硬件和上层应用的中间层基础设施。主要包含底层系统架构、编译器、AI 框架等**纵向**的基础软硬件设施。 -[](images/05Foundation05.png) +![](images/05Foundation05.png) ### AI Infra(AI 基础设施) 大模型时代对 AI 基础设施的需求,与传统机器学习时代的工具栈侧重点有所不同。AI Infra 主要是从 AI 训练模型、构建 AI 赋能应用的工作流视角出发,更加关注 AI 在大模型开发、训练和推理部署的相关环节,即从 AI 训练和推理的环节过程作为代表,历经从数据准备、模型训练、模型部署、产品整合等不同环节。因此更强调的是从大模型数据准备到训练、推理、应用横向的软硬件基础设施。 -[](images/05Foundation06.png) +![](images/05Foundation06.png) #### 数据准备 From e2693062c8d8d0cc6217610e50815cb3927bb41e Mon Sep 17 00:00:00 2001 From: zsheli Date: Wed, 17 Dec 2025 17:13:24 +0800 Subject: [PATCH 2/2] Update 06Foundation.md --- 01Introduction/06Foundation.md | 4 +--- 1 file changed, 1 insertion(+), 3 deletions(-) diff --git a/01Introduction/06Foundation.md b/01Introduction/06Foundation.md index 39eafcef..05bccbf1 100644 --- a/01Introduction/06Foundation.md +++ b/01Introduction/06Foundation.md @@ -173,9 +173,7 @@ AI 系统对于新算法研究的重要性日益凸显,如今已不仅仅是 稳定性/成本:集群容错是一个 2023 年比较热门的话题,也是大型企业造大模型时的真实需求。同时还有一个高度关联的方向,弹性计算,也得到了广泛的关注。早期工作包括 Varuna [EuroSys'22](Best Paper)和 Bamboo [NSDI'23],今年也出现了一些 Competitors,比如 Gemini [SOSP'23], Parcae [NSDI'24]和 Oobleck [SOSP'23]。这些方向 2024 年可能会得到更多关注。 -推理 - -效率:incremental decoding 改变了 LLM 中的部分算子实现机制,但经过 23 年一整年的 Kernel 优化,硬件性能也几乎已经压榨到极限(主要指访存带宽)。展望 2024,在系统效率,尤其是 end-to-end inference latency 这一单一指标上,能比现在 SOTA 方案做的多好其实是要画问号的。一个可能的方向是 speculative decoding;另外如果是围绕其他性能指标如 throughput 和 TTFT/TPOT 展开优化,应该也还有一些可做的空间;如果是能够再牺牲“亿”点点模型效果,不保证输出内容严格对齐的话,那可做的事情就更多了。这部分详细内容可以参考综述论文:Hsword:大模型如何高效部署?CMU 最新万字综述纵览 LLM 推理 MLSys 优化技术 +推理效率:incremental decoding 改变了 LLM 中的部分算子实现机制,但经过 23 年一整年的 Kernel 优化,硬件性能也几乎已经压榨到极限(主要指访存带宽)。展望 2024,在系统效率,尤其是 end-to-end inference latency 这一单一指标上,能比现在 SOTA 方案做的多好其实是要画问号的。一个可能的方向是 speculative decoding;另外如果是围绕其他性能指标如 throughput 和 TTFT/TPOT 展开优化,应该也还有一些可做的空间;如果是能够再牺牲“亿”点点模型效果,不保证输出内容严格对齐的话,那可做的事情就更多了。这部分详细内容可以参考综述论文:Hsword:大模型如何高效部署?CMU 最新万字综述纵览 LLM 推理 MLSys 优化技术 易用性:自动并行在推理侧看起来没有太多有趣的东西,主流框架已经可以把各种并行策略(如 TP/PP)支持的很好了。个人感觉,随着大模型使用场景的复杂性逐渐增加,未来更值得关注的可能是如何把推理引擎更好地和整套 AI Service 产品 Pipeline 相结合,提高整体的部署和服务效率。