首页
游戏
影视
直播
广播
听书
音乐
图片
更多
看书
微视
主播
统计
友链
留言
关于
论坛
邮件
推荐
我的云盘
我的搜索
我的记录
我的图片
我的图书
我的笔记
我的音乐
我的影视
我的邮件
我的游戏
Search
1
virtuoso和empyrean alps模拟仿真和混仿教程
359 阅读
2
在IC617中进行xa+vcs数模混仿
300 阅读
3
文档内容搜索哪家强? 15款文件搜索软件横向评测
264 阅读
4
科普:Memory Compiler生成的Register file和SRAM有何区别?
257 阅读
5
通俗易懂的AI知识体系图及其产业链全景图
198 阅读
默认分类
芯片市场
数字电路
芯片后端
模拟电路
芯片验证
原型与样片验证
算法与架构
DFX与量产封装
PC&Server OS设置
移动OS设置
软件方案
新浪备份
有道备份
登录
Search
标签搜索
AI
python
Docker
vcs
PyQT
STM32
cadence
linux
systemverilog
EDA
Alist
vscode
uos
package
MCU
C
QT
CXL
sed
sv
bennyhe
累计撰写
387
篇文章
累计收到
33
条评论
首页
栏目
默认分类
芯片市场
数字电路
芯片后端
模拟电路
芯片验证
原型与样片验证
算法与架构
DFX与量产封装
PC&Server OS设置
移动OS设置
软件方案
新浪备份
有道备份
页面
游戏
影视
直播
广播
听书
音乐
图片
看书
微视
主播
统计
友链
留言
关于
论坛
邮件
推荐
我的云盘
我的搜索
我的记录
我的图片
我的图书
我的笔记
我的音乐
我的影视
我的邮件
我的游戏
搜索到
26
篇与
的结果
2026-04-10
AI专题十:算力芯片对比与算力芯片指标
一、NVIDIA GPU系列型号架构显存内存带宽FP8算力FP4算力TDP定位A100Ampere80GB HBM2e2 TB/s--400W上一代通用H100 SXMHopper80GB HBM33.35 TB/s3,958 TFLOPS-700W当前训练主力H200 SXMHopper141GB HBM3e4.8 TB/s3,958 TFLOPS-700W大模型推理优化B200Blackwell192GB HBM3e8 TB/s9,000 TFLOPS18,000 TFLOPS1000W2025旗舰关键洞察:• H200与H100计算性能相同(3,958 TFLOPS FP8),但内存容量提升76%(141GB vs 80GB),带宽提升43%(4.8 vs 3.35 TB/s)spheron.networkspheron.netw…• B200采用双die封装,FP8算力是H100的2.3倍,内存带宽是H200的1.7倍 GPU Cloud• B200的180-192GB显存可单卡容纳70B-180B参数模型,无需张量并行 二、华为昇腾系列(国产)型号工艺显存内存带宽FP16算力设计特点出货情况昇腾910B中芯N+1(7nm)64GB HBM2e400GB/s → 1.2TB/s(910B3)320 TFLOPS达芬奇架构,受限工艺2024年出货约40万颗昇腾910C中芯N+2(7nm)HBM2e/HBM3~1.2TB/s800 TFLOPS双die合封(类似B200)2025年预计70-80万颗关键洞察:910C采用双die封装设计,将两颗910B整合,FP16算力达800 TFLOPS,约为H100的80% 910C芯片逻辑面积比H100多60%,架构效率仍有差距 中芯国际N+2工艺良率从2024年20%提升至2025年40-50% 910B均价约11万元/片,910C约18-20万元/片,远低于H100的2.5-3万美元 未来路线图(2025-2028):昇腾950:引入FP8/FP4,算力达1 PFLOPS(FP8),支持SIMT编程模型昇腾960/970:每代算力翻倍,970达8 PFLOPS(FP4),能效比提升30%三、AMD GPGPU系列型号架构显存内存带宽FP8算力特点发布时间MI300XCDNA 3192GB HBM35.3 TB/s2,614 TFLOPS内存容量领先H100已发布MI325XCDNA 3256GB HBM3E6 TB/s-内存进一步提升2024年底MI350XCDNA 4 (3nm)288GB HBM3E8 TB/s-FP4/FP6支持,推理性能提升35倍2025年中关键洞察:MI300X的192GB HBM3容量超过H100(80GB),带宽5.3 TB/s也高于H100的3.35 TB/s AMD软件生态(ROCm)仍是最大短板,CUDA代码移植困难 MI350X将支持FP4/FP6,与NVIDIA B200直接竞争四、Google TPU系列型号定位峰值性能内存互联特点发布时间TPU v5e推理优化393 TOPS (INT8)-256芯片Pod2.5倍推理性价比2023TPU v5p训练100 Peta-OPS INT8 (Pod)--训练导向2023TPU v6e (Trillium)训练+推理4.7倍v5峰值2倍v5容量Jupiter: 100K芯片/Pod训练Gemini 2.0,能效提升67%2024TPU v7x (Ironwood)推理优先~4,614 TFLOPS/芯片 ( rumored)192GB~9,216芯片/Pod专为LLM调优,30倍能效提升2025预览五、综合对比表厂商旗舰型号显存容量内存带宽FP8算力制程核心优势主要短板NVIDIAB200192GB8 TB/s9 PFLOPS4NP生态垄断(CUDA)、性能最强价格极高、供应受限NVIDIAH200141GB4.8 TB/s3.96 PFLOPS4N内存升级、软件兼容算力与H100相同AMDMI350X288GB8 TB/s-3nm内存容量最大、性价比高软件生态(ROCm)弱AMDMI300X192GB5.3 TB/s2.6 PFLOPS5nm大显存、成本较低软件支持不足华为910C-~1.2 TB/s0.8 PFLOPS (FP16)7nm(N+2)国产自主、供应链安全单卡性能落后1-2代华为910B64GB1.2 TB/s0.32 PFLOPS7nm(N+1)国产替代首选性能落后、生态建设中GoogleTPU v6e--4.7倍v5-与云深度整合、能效高仅云可用、灵活性差GoogleTPU v7x192GB-~4.6 PFLOPS-推理优化、超大规模Pod尚未正式发布六、关键趋势总结维度趋势内存容量竞赛从80GB(H100) → 192GB(B200/MI300X) → 288GB(MI350X),大模型单卡部署成关键内存带宽瓶颈推理阶段带宽比算力更重要,8 TB/s成为新标杆精度降低FP8→FP4普及,B200支持FP4实现18 PFLOPS国产替代加速华为昇腾910C大规模出货(70-80万颗/年),性能达H100 80%软件生态分化CUDA仍垄断,但ROCm、CANN、XLA/JAX多极竞争Chiplet架构B200、910C、MI300X均采用多die封装,提升良率和扩展性七、核心算力单位:TOPS vs TFLOPSTOPS:整数算力的代表TOPS 的全称是Tera Operations Per Second,拆解来看:OPS:Operations Per Second,即每秒完成的计算操作次数;T:Tera,代表 1 万亿(10¹²)。所以1 TOPS = 每秒完成 1 万亿次整数运算。它主要用于衡量AI 推理场景的算力,比如图像识别、目标检测、分类等边缘 AI 任务,像 Jetson 系列边缘开发板,标注算力时就常用 TOPS。简单记:TOPS = 整数算力,看 AI 推理快不快。TFLOPS:浮点算力的代表TFLOPS 的全称是Tera Floating-point Operations Per Second,拆解来看:FLOPS:Floating-point Operations Per Second,即每秒完成的浮点运算(带小数点的数)次数;T:同样代表 1 万亿。所以1 TFLOPS = 每秒完成 1 万亿次浮点运算。它主要用于衡量深度学习训练、科学计算场景的算力,比如显卡、大型训练集群标注算力时,就常用 TFLOPS。简单记:TFLOPS = 小数算力,看训练 / 科学计算强不强。八、关键数据类型:FP32、FP16、INT8 详解INT8:8 位整数存储规则:用 8 位二进制存储,只能表示整数,范围是 - 128~127,没有小数点,不存在 “小数点后几位” 的概念;通俗举例:只能存 1、5、-10 这类整数,存不了 1.5、3.14 这类小数;核心特点:占用空间最小,计算速度最快,精度最低(仅支持整数运算);对应算力单位:TOPS;适用场景:AI 推理(模型量化后常用,在保证精度损失极小的前提下,大幅提升推理速度、降低内存占用)。FP16:16 位浮点存储规则:用 16 位二进制存储小数,其中1 位符号位、5 位指数位、10 位尾数位,小数点后能保留约 3~4 位有效数字;通俗举例:能存 3.14、0.005、-2.7 这类小数,但如果是 3.1415926,会近似存为 3.1416,小数点后第 5 位会四舍五入;核心特点:速度快,显存 / 内存占用小,平衡了速度与精度;对应算力单位:TFLOPS;适用场景:深度学习训练、推理都常用(混合精度训练的核心数据类型,既能保证训练效果,又能提升速度)。FP32:32 位浮点存储规则:用 32 位二进制存储小数,其中1 位符号位、8 位指数位、23 位尾数位,小数点后能保留约 6~7 位有效数字;通俗举例:能精准存 3.1415926、0.0001234、-5.678901 这类小数,小数点后前 7 位基本不会丢失精度;核心特点:精度最高,但计算速度最慢,占用空间最大(是 FP16 的 2 倍、INT8 的 4 倍);对应算力单位:TFLOPS;适用场景:科学计算、部分对精度要求极高的训练 / 推理任务(比如医学影像分析、高精度数值模拟)。三者核心区别与算力影响总结对算力的核心影响:数据类型位数越少,芯片一次能并行处理的计算次数越多,算力自然越高。比如同一块芯片,INT8 算力通常是 FP16 的 2 倍、FP32 的 4 倍 —— 因为 INT8 占 8 位,芯片一次能处理 4 个 INT8 数据,而 FP32 占 32 位,一次只能处理 1 个,算力差距就此拉开。九、数据类型与算力的关系:越小越快,算力越高很多新人会疑惑:为什么同一块芯片,INT8 算力比 FP32 高这么多?核心原因就在于数据类型的位数。数据类型的位数越少,芯片一次能并行处理的计算次数就越多,算力自然越高。同一块芯片的算力规律是:INT8 算力 > FP16 算力 > FP32 算力。举个直观的例子:算 INT8(8 位):芯片一次能处理 8 个数据,算力达到峰值;算 FP16(16 位):芯片一次只能处理 4 个数据,算力减半;算 FP32(32 位):芯片一次仅能处理 2 个数据,算力最低。这也是为什么 AI 推理 常用 INT8,训练常用 FP16,高精度计算才用 FP32 的原因。十、实战结合:从硬件算力到模型推理速度我们先来看这张 YOLO26 系列模型的性能对比表,它直观展示了不同尺寸模型在精度、速度、计算量上的差异,是我们理解 “硬件算力” 和 “模型计算量” 关系的绝佳例子:这张表是 YOLO26 系列(n/s/m/l/x 从最小到最大)在 COCO 数据集上的实测结果,其中最关键的一列是 FLOPs(B),它代表每个模型完成一次推理(输入一张 640×640 图片)需要的浮点运算次数(单位是十亿次)。先看 Jetson AGX Orin 的硬件算力(FLOPS)Jetson AGX Orin 作为边缘 AI 硬件,它的算力是硬件本身的 “速度指标”,表示每秒能完成多少次浮点运算,官方参数如下:FP16(半精度浮点)算力:约 6.666 TFLOPS(每秒 6.666 万亿次浮点运算)FP32(单精度浮点)算力:约 3.333 TFLOPS(每秒 3.333 万亿次浮点运算)INT8(整数)算力:200~275 TOPS(对应边缘 AI 推理场景)简单记:硬件算力(FLOPS)就像你的 “跑步速度”,比如每秒能跑 10 米。再看模型计算量(FLOPs)表中的 FLOPs(B) 是模型的 “工作量指标”,表示完成一次推理需要多少次浮点运算。比如:YOLO26n(最小模型):5.4B → 一次推理需要 5.4 十亿次浮点运算YOLO26s(中等模型):20.7B → 一次推理需要 20.7 十亿次浮点运算YOLO26x(最大模型):193.9B → 一次推理需要 193.9 十亿次浮点运算简单记:模型计算量(FLOPs)就像你要跑的 “路程”,比如跑 100 米需要 100 步。两者的核心区别:速度 vs 工作量两者的关系:硬件算力 × 时间 = 模型计算量就像 “跑步速度 × 跑步时间 = 跑步距离”,硬件算力和模型计算量的关系可以用公式表示:理论推理速度(FPS,每秒处理图片数)= 硬件算力(FLOPS) ÷ 模型计算量(FLOPs)用 Jetson AGX Orin + YOLO26 系列举例:我们用 Orin 的 FP16 算力(6.666 TFLOPS = 6.666×10¹² 次 / 秒)来计算不同模型的理论 FPS :实际意义:选模型、配硬件的核心逻辑• 如果你的硬件算力(FLOPS)固定(比如用 Jetson AGX Orin),模型计算量(FLOPs)越小,推理速度越快,越适合边缘场景;• 如果你的模型计算量(FLOPs)固定(比如选 YOLO26x),硬件算力(FLOPS)越高,推理速度越快,越适合高性能场景。这也是为什么表格中 YOLO26n 速度最快、YOLO26x 速度最慢的原因 —— 计算量直接决定了硬件需要 “跑多远”。时、总结:核心要点最后把所有知识点浓缩成 7 句话,记牢这几句就够:算力 = 芯片每秒完成的计算次数;TOPS 是整数算力,对应 INT8,主打 AI 推理;TFLOPS 是浮点算力,对应 FP16/FP32,主打训练 / 科学计算;INT8:8 位整数,无小数点,最快、最小、精度最低;FP16:16 位浮点,小数点后约 3~4 位精度,速度与精度平衡,最常用;FP32:32 位浮点,小数点后约 6~7 位精度,精度最高、最慢、占用最大;同芯片算力:INT8 > FP16 > FP32。十一:TFLOPS 是是指计算fp32、fp16, 还是fp8?TFLOPS 的定义术语全称含义TFLOPSTera Floating Point Operations Per Second每秒万亿次浮点运算TOPSTera Operations Per Second每秒万亿次运算(含整数) 不同精度的算力关系(以NVIDIA H100为例)精度算力相对FP32倍数应用场景FP64(双精度)67 TFLOPS0.5x科学计算(气象/物理模拟)FP32(单精度)134 TFLOPS1x通用计算、传统深度学习TF32 Tensor Core989 TFLOPS7.4x训练默认精度(接近FP32范围+FP16精度)BF16 Tensor Core1,979 TFLOPS14.8x训练主流(与FP32相同范围)FP16 Tensor Core1,979 TFLOPS14.8x混合精度训练FP8 Tensor Core3,958 TFLOPS29.5x大模型训练/推理主流INT83,958 TOPS-量化推理规律:每降低一档精度,理论算力翻倍(利用Tensor Core的并行度提升)。厂商宣传惯例场景通常引用的精度原因科学计算/数据中心通用FP64/FP32传统HPC领域标准AI训练(2020年前)FP16/TF32混合精度训练时代AI训练/推理(当前)FP8大模型时代主流,数字最大最好看极致量化推理FP4/INT8边缘部署、极致压缩为什么大模型用FP8?因素说明Transformer特性Attention计算对数值精度不敏感,FP8足够内存带宽节省FP8比FP16省50%带宽,缓解内存墙训练稳定性配合Transformer Engine的动态缩放,FP8训练已成熟硬件支持H100/B200原生FP8 Tensor Core,无额外开销实际工程中的算力计算示例:H100 SXM5官方标称:FP8: 3,958 TFLOPS(宣传用,数字最大)FP16: 1,979 TFLOPSFP32: 134 TFLOPS(无Tensor Core)FP64: 67 TFLOPS实际大模型训练:使用FP8 + Transformer Engine有效算力通常为理论值的10-30%(内存带宽、通信、算法效率限制)实际约 400-1,200 TFLOPS一句话总结TFLOPS是单位,必须带精度才有意义。当前大模型领域默认指FP8 TFLOPS,但看实际性能时,内存带宽(GB/s)和显存容量(GB)往往比算力数字更重要。对比芯片时,务必确认:同精度对比(都用FP8或都用FP16)看内存带宽(推理瓶颈)看显存容量(模型能不能放下)看互联带宽(多卡扩展能力)
2026年04月10日
48 阅读
0 评论
0 点赞
2026-04-10
AI专题九:大模型与算力芯片
一 运行大模型的算力芯片分类目前大模型运行芯片类型多样,各有侧重。以下是系统梳理:芯片类型代表厂商/产品核心定位大模型场景GPUNVIDIA H100/B200/RTX、AMD MI300X通用并行计算训练+推理主力GPGPUNVIDIA A100/H100、AMD Instinct通用计算GPU(去掉图形管线)数据中心AI训练TPUGoogle Cloud TPU v5p专用AI加速器Google生态训练NPU苹果Neural Engine、高通Hexagon端侧AI推理手机/PC本地大模型DPUNVIDIA BlueField、AMD Pensando数据处理器(卸载网络/存储)数据中心基础设施IPUGraphcore(已被收购)图处理器曾用于GNN/稀疏计算LPUGroq语言处理器(SRAM架构)低延迟推理NPU(国产)华为昇腾910B、寒武纪MLU370国产AI训练/推理国产替代方案DSA百度昆仑芯、阿里含光800领域专用架构特定场景优化FPGAAMD/Xilinx Versal、Intel Agilex可编程逻辑原型验证、低量产场景CPUIntel Xeon、AMD EPYC通用处理器小模型推理、预处理存算一体知存科技、后摩智能存储内计算边缘低功耗推理二、核心概念辨析对比项GPU(图形处理器)GPGPU(通用计算GPU)设计初衷图形渲染(游戏/显示)科学计算、AI、数据分析功能完整性含图形管线(光栅化、纹理等)去掉图形专用单元,专注计算典型产品NVIDIA RTX 4090、AMD RX 7900NVIDIA A100/H100、AMD MI300X使用场景游戏、内容创作、轻量AI数据中心大模型训练DPU的特殊定位特性说明核心功能卸载CPU的网络、存储、安全任务(SmartNIC进化版)与GPU关系协同工作,不是替代。DPU管"数据搬运",GPU管"计算"大模型作用优化多卡通信(RDMA、集合通信加速)、存储虚拟化典型架构ARM核心 + 硬件加速引擎(加密/压缩/网络)+ PCIe交换CPU(控制) ←→ DPU(网络/存储卸载) ←→ GPU(计算) ↓ 高速互联(NVLink/InfiniBand)三、各类芯片深度对比训练场景芯片对比芯片架构特点优势劣势NVIDIA H100/B200Transformer Engine、FP8支持、NVLink 4.0生态垄断(CUDA)、性能最强价格极高、供应受限AMD MI300X192GB HBM3、统一内存架构显存大、性价比高软件生态(ROCm)弱于CUDAGoogle TPU v5p脉动阵列、BF16优化与Google云深度整合、大规模Pod灵活性差、仅云可用华为昇腾910B达芬奇架构、HBM2e国产自主、政府/金融首选单卡性能落后1-2代、软件生态建设中Intel Gaudi3张量处理器 + 以太网互联成本较低、开放以太网生态弱、市场份额小推理场景芯片对比芯片类型优势场景代表产品关键指标高端GPU高吞吐、大batch推理NVIDIA H100/L4吞吐量(tokens/sec)LPU(Groq)超低延迟、确定性延迟Groq Chip延迟<1ms、无HBM瓶颈NPU(端侧)低功耗、本地隐私苹果M4 Neural Engine、高通X Elite能效比(TOPS/Watt)DSA(定制)特定模型极致优化百度昆仑芯、阿里含光特定模型性价比存算一体超边缘、TinyML知存科技WTM-8功耗<1mW四、架构演进趋势从通用到专用 2012-2017:CPU → GPU(通用并行)2017-2022:GPU → TPU/IPU(AI专用)2022-现在:GPU → DPU+GPU协同(系统级优化)未来:存算一体、光子计算、神经形态芯片关键技术创新方向技术原理代表近存计算计算靠近存储,减少数据搬运阿里含光800、GroqChiplet/芯粒模块化封装,灵活组合AMD MI300X、Intel Ponte VecchioHBM高带宽存储3D堆叠内存,突破带宽墙HBM3e(1.2TB/s)CPO光电共封装光互连替代电互连NVIDIA、Broadcom研发中稀疏计算加速利用MoE等稀疏性NVIDIA Transformer Engine五、选型决策框架场景首选芯片关键考量大模型训练(100B+)NVIDIA H100/B200集群CUDA生态、NVLink互联、FP8支持训练(预算敏感)AMD MI300X、华为昇腾910B集群性价比、国产合规云端高吞吐推理NVIDIA L4/L40S、自研DSA成本($/token)、功耗超低延迟推理Groq LPU、高端GPU+优化首token延迟(TTFT)端侧(手机/PC)NPU(苹果/高通/联发科)能效比、隐私保护边缘/嵌入式存算一体芯片、FPGA功耗<1W、成本<$10国产替代华为昇腾、寒武纪、百度昆仑芯供应链安全、政策支持六、芯片算力是怎么计算的?基本公式精度算力公式说明FP32(单精度浮点)算力 = 频率 × CUDA核心数 × 2每个核心每周期2次FMA运算FP16/BF16(半精度)算力 = FP32算力 × 2张量核心支持2倍吞吐FP8/INT8算力 = FP32算力 × 4更低精度4倍吞吐稀疏化(2:4)算力 = dense算力 × 2利用稀疏性再翻倍H100 SXM5 规格:GPU频率:约1.98 GHz(动态调整)CUDA核心数:16896个(但张量核心更重要)张量核心:528个第四代Tensor CoreFP8算力计算:= 频率 × Tensor Core数量 × 每周期操作数 × 稀疏加速= ~1.98GHz × 528 × 2048 × 2(稀疏)≈ 3958 TFLOPS(与官方3958 TFLOPS FP8一致)关键:现代GPU算力主要来自Tensor Core,非CUDA Core实际有效算力 vs 理论峰值因素影响典型效率内存带宽瓶颈数据供给跟不上计算10-30%(HBM瓶颈)算法效率无法利用全部并行度30-60%通信开销多卡同步等待20-50%(大规模集群)实际有效算力理论峰值 × 综合效率通常5-20%案例:H100理论3958 TFLOPS FP8,大模型训练实际可能只有200-400 TFLOPS(5-10%效率)。七、芯片算力与大模型参数的关系训练阶段:算力需求估算指标公式示例(GPT-3 175B)训练token数通常2-10倍参数量300B tokens总计算量≈ 6 × 参数量 × token数6 × 175B × 300B = 3.15e23 FLOPs所需GPU小时总FLOPs / (GPU算力 × 效率)约3648 GPU小时(1024张H100,3.5天)Transformer前向+反向计算量 ≈ 6 × P × DP: 参数量D: token数系数6: 前向2次,反向4次(梯度计算)推理阶段:算力与内存的博弈阶段瓶颈关键公式Prefill(首token)计算密集型时间 ∝ (参数 × 序列长度) / 算力Decode(生成token)内存带宽密集型时间 ∝ 参数 / 内存带宽关键洞察:推理瓶颈转移点:短序列(<1K):Prefill主导,算力重要长序列(>4K):Decode主导,内存带宽重要超长序列(>32K):KV Cache容量成为瓶颈参数-算力-内存三角关系 参数量(P) ↑ / \ / \ / \ / △ \ / 优化 \ /____________\ 算力(FLOPS) ←→ 内存带宽(GB/s)场景瓶颈维度优化方向训练大模型算力 + 互联带宽更多GPU + NVLink/InfiniBand长上下文推理内存带宽 + 容量HBM3e + KV Cache压缩(MQA/GQA)低延迟推理算力密度 + 片上SRAMGroq LPU(230MB SRAM,无HBM)端侧部署内存容量 + 功耗量化(INT4)+ 剪枝 + NPU专用八、大模型参数设计的芯片约束参数规模 vs 硬件匹配参数规模典型模型单卡显存需求训练配置7BLLaMA-2-7B~14GB(FP16)单卡RTX 4090可推理13BLLaMA-2-13B~26GB单卡A100或双卡409070BLLaMA-3-70B~140GB8×A100(80GB)或2×H100175BGPT-3~350GB数百张V100/A100405BLLaMA-3.1-405B~810GB16K+ H100 GPU集群1T+GPT-4/文心5.0~2TB+万卡集群 + 专家并行MoE架构:参数与算力的解耦架构总参数激活参数显存占用计算量Dense(密集)100B100B200GB100B × tokenMoE(稀疏)1T100B(10%)~400GB(共享+专家)100B × token九、实际工程计算示例场景:用H100训练LLaMA-3-70B已知:模型:70B参数数据:1.4T tokens(约20倍参数,较充分训练)硬件:H100 SXM5(80GB HBM3,FP8 3958 TFLOPS)并行策略:张量并行8路 + 流水线并行4路 = 32卡计算:总计算量 = 6 × 70B × 1.4T = 5.88e20 FLOPs单卡有效算力(假设10%效率)= 3958 × 0.1 = 395 TFLOPS32卡集群总有效算力 = 32 × 395 = 12640 TFLOPS = 1.264e13 FLOPS训练时间 = 5.88e20 / 1.264e13 = 4.65e7秒 ≈ 540小时 ≈ 22.5天实际:配合 checkpoint、故障恢复,通常需3-4周场景:H100推理LLaMA-3-70B,batch=1 已知:模型:70B参数,FP16序列:4K上下文硬件:H100(3.35TB/s HBM带宽)计算:加载权重时间:140GB / 3.35TB/s ≈ 42ms(可忽略,常驻显存)Prefill阶段(4K tokens):计算量 ≈ 2 × 70B × 4K = 5.6e14 FLOPs时间 ≈ 5.6e14 / 3958e12 ≈ 141ms(若算力瓶颈)实际受内存带宽限制,可能更长Decode阶段(每生成1 token):需加载全部70B参数:140GB时间 = 140GB / 3.35TB/s ≈ 42ms(纯带宽瓶颈)实际约30-50ms/token优化后(vLLM/PagedAttention,batch增大):batch=16时,吞吐可达~2000 tokens/s十、关键结论关系核心洞察算力≠性能内存带宽、互联带宽、软件效率同样关键参数≠能力MoE架构解耦参数与计算,效率优先训练看算力算力决定训练速度,集群规模决定模型上限推理看带宽生成阶段内存带宽是瓶颈,非算力端侧看能效功耗约束下,专用NPU比通用GPU优10-100倍
2026年04月10日
29 阅读
0 评论
0 点赞
2026-04-10
AI专题七:大模型的参数
大模型也是有大有小的,它们的大小靠参数数量来度量。GPT-3就有1750亿个参数,而Grok-1更是不得了,有3140亿个参数。当然,也有像Llama这样身材苗条一点的,参数数量在70亿到700亿之间。这里说的70B可不是指训练数据的数量,而是指模型中那些密密麻麻的参数。这些参数就像是一个个小小的“脑细胞”,越多就能让模型更聪明,更能理解数据中那些错综复杂的关系。有了这些“脑细胞”,模型在处理任务时可能就会表现得更好。大模型的这些参数就像是模型内部的“建筑师”,通过复杂的算法和训练过程,一点一滴地搭建起这个庞大的语言世界。每个参数都有它的作用,它们共同协作,让模型能够更准确地理解我们的语言,并给出更合适的回答。那么,大模型中的参数是怎样构成的呢?大模型中的参数大模型参数是其“内部零件”,这些零件各有各的用途,通常包括但不限于以下几类:权重(Weights):权重就像神经网络里的“电线”,连接着各个神经元。它们负责调整信号传递时的“音量”,让重要的信息传得更远,不那么重要的信息就小声点。比如在全连接层里,权重矩阵W就是一张“地图”,告诉我们哪些输入特征和输出特征关系最密切。偏置(Biases):偏置就像是神经元的“小助手”,负责给神经元的响应定个基准。有了它,神经元就知道自己该在什么水平上活跃了。注意力机制的参数(Attention Parameters):在基于Transformer的模型中,这些参数就像是“指南针”,告诉模型哪些信息最值得关注。它们包括查询矩阵、键矩阵和值矩阵等,就像是在一大堆信息中找出最关键的“线索”。嵌入矩阵(Embedding Matrices):在处理文本数据时,嵌入矩阵就是模型的“字典”。每一列都代表一个词汇,用一个数来表示这个词。这样,模型就能理解文本的意思了。隐藏状态初始化参数(Initial Hidden State Parameters):这些参数就是用来设置模型最初的隐藏状态的,就像是给模型定个基调,让它知道从哪里开始“思考”。......这些参数一般会使用4种表达和存储的格式:Float: 32比特的浮点数,即4字节Half/BF16: 16比特的浮点数,即2字节Int8: 8比特的整数,即1字节Int4: 4比特的整数,即0.5字节一般来说,参数的数量是影响大模型性能的主要因素。例如,13B-int8模型通常优于同一体系结构的7B-BF16模型。大模型参数对内存的需求对于工程师而言,面对的是大模型训练或推理时会使用多少的内存资源。尽管 V100(有32 GB 的 GPU 内存)或 A100(有40 GB 的 GPU 内存)很强大,然而,大模型却并不能使用 Tensorflow 或 PyTorch 的单个 GPU 上进行训练。2.1 训练阶段的内存需求在模型训练期间,主要体现为模型状态和激活过程对内存的存储需求。模型状态包括由优化器状态、梯度和参数组成的张量。激活过程中包括在正向通道中创建的任何张量,这些张量是在反向通道中梯度计算所必需的。在训练的任何时候,对于每个模型参数,总是需要有足够的 GPU 内存来存储:模型参数复制的字节数x梯度复制的字节数y优化器状态一般为12个字节,主要是参数、方差等的拷贝,会将所有优化器状态保存在 FP32中,以保持稳定训练并避免数值异常。这意味着,训练时需要如下内存来存储所有的模型状态和过程数据:(x+y+12 ) * model_size2.2 推理阶段的内存需求推理阶段利用预先训练好的 LLM 完成文本生成或翻译等任务。在这里,内存需求通常较低,主要的影响因素:有限的上下文: 推理通常处理较短的输入序列,需要较少的内存来存储与较小的文本块相关的激活。无反向传播: 在推理过程中,LLM 不需要保留反向传播的中间值,这是一种用于训练调整参数的技术。这消除了大量的内存开销。推理阶段所需的内存不会高于相同参数计数和类型的训练阶段所需内存的四分之一。例如,对于一个7B的模型而言,大体上,使用浮点精度需要28GB内存,使用BF16精度需要14GB内存,使用int8精度需要7GB内存。这个粗略的估计方式可以相应地应用到其他版本的模型。另外,当根据特定任务调整 LLM 时,微调需要更高的内存占用。微调通常包括更长的训练序列来捕捉目标任务的细微差别。当 LLM 处理更多的文本数据时,这将导致更大的激活。反向传播过程需要存储用于梯度计算的中间值,这些中间值用于在训练期间更新模型的权重。与推理相比,这增加了大量的内存负担。2.3 基于Transformer的大模型的内存估算具体而言, 对应基于Transformer的大模型,尝试计算一下训练时所需的内存,其中设:l :transformer的层数a:attention 的head 数量b:批次大小s:序列长度h:隐藏层的维度大小p:精度这里, bshp = b s h * p 代表了输入数据量的大小。在transformer 的线性层部分,大概需要9bshp+bsh 的空间来用于后面的激活。在attention 部分,self-attention 可以表达为:softmax((XQ)(XK)^T)XV那么,XQ,XK,XV均需bshp大小的空间。在标准self-attention中,乘法(XQ) (XK) ^ T 的结果只是一个包含 logit 的 b s s 矩阵。然而在实践中,由于使用了多头注意力机制,需要为每个头都要建立一个单独的 s s 存储空间。这意味着需要 abssp 字节的空间,而存储 softmax 的输出也同样需要 abssp 字节。在 softmax 之后还一般需要额外的 abss 字节来存储掩码,所以 attention部分需要2abssp+abss的存储空间。此外,transformer中还有两个Norm layer,每个仍需bshp的存储空间,共2个bshp。所以,基于Transformer 的大模型训练所需内存大约为:L(9bshp+bsh+2abssp+abss +2bshp) = Lbshp[16+2/p+(as/h)(2+1/p)]解释一下,训练基于Transformer 的大模型所需内存大约是:模型的层数 x 训练批次的大小 x 序列长度 x 隐藏层的维度 x 精度 x 大于16的整数这或许就是基于Transfromer的大模型参数对训练时内存需求的一个理论下界。大模型参数对GPU 的需求有了大模型参数对内存的要求, 可以进一步估算大模型在训练和推理中所需的GPU数量。但由于GPU数量估算依赖的参数稍多,有人(Dr. Walid Soula,https://medium.com/u/e41a20d646a8)给出了一个粗略估算的简单公式, 在工程上同样有一定的参考意义。其中,Model’s parameters in billions 是以B为单位的模型参数数量;18是训练期间不同组件的内存占用因子;1.25 代表了激活过程所需的内存数量因子,激活是随着模型处理输入数据而变化的动态数据结构。GPU Size in GB是可用的 GPU 内存总量举个实际的例子,假设使用的是 NVIDIA RTX 4090 GPU,它有24GB 的 VRAM,计算一下训练‘ Llama3 7B’模型所需的 GPU 数量,大约为 :GPU 的总数≈(7 18 1.25)/24,大约等于7对于推理而言, 可以简化为训练阶段的1/8~1/9 , 当然,这些只是一般意义的粗略估计。由大模型参数到分布式训练理解大模型参数的组成及其对内存和GPU的需求,有助于深入掌握分布式训练在工程实践中所面临的挑战。采用专为分布式训练设计的框架,例如TensorFlow或PyTorch,可以显著简化分布式训练策略的实施过程,这些框架提供了丰富的工具和API。通过运用梯度累积等技术在更新模型前,或利用梯度压缩等技术减少节点间的数据交换量,可以有效降低通信成本。确定分布式训练的最佳批次大小(即前文提到的参数b)至关重要;b值过小可能增加通信开销,而过大则可能导致内存不足。LLMOps的重要性日益凸显。定期监控为分布式训练配置的性能指标,调整超参数、分区策略和通信设置以优化性能,是提升训练效率的关键。实施模型的检查点机制并在发生故障时进行有效的恢复,可以确保训练过程在无需从头开始的情况下继续进行。换句话说,大模型的训练/推理本质上是一个复杂的分布式系统架构工程挑战,例如:通信开销:在执行梯度计算和数据更新时,通信所需时间可能会影响整体的加速效果。同步复杂性:多台机器并行训练时,同步的复杂性需要谨慎设计。容错与资源管理:单点故障对模型训练和推理的影响,以及CPU与GPU的资源分配与调度策略。......然而,实际上大多数工程师可能并不直接参与具体的训练工作,而是关注在构建应用时可以如何利用大模型的参数。大模型应用中使用的参数了解大模型应用的编程范式,即面向Prompt的编程,可以参考相关文字如《解读提示工程(Prompt Engineering)》和《Agent 应用于提示工程》以及《提示工程中的10个设计模式》。这里主要关注在使用大模型输出文本时,可以配置的三个参数:Temperature、Top-K和Top-P。Temperature参数通常被误解为仅控制模型创造性的开关,但其实它更深层的作用是调节概率分布的“软性”。当Temperature值设置较高时,概率分布变得更柔和、均匀,这促使模型生成更多样化、具创造性的输出。反之,较低的Temperature值会使分布更尖锐,峰值更明显,从而倾向于产生与训练数据类似的输出。Top-K参数用于限制模型在每个步骤中输出最可能的Top-K个标记,通过这种方式可以减少输出中的不连贯或无意义内容。这种策略在维持输出的最有可能的一致性与允许一定程度的创造性抽样之间形成平衡。Top-P是另一种解码方法,它根据设定的P值(0≤P≤1)来选择一组累积概率超过P值的最小单词集合作为输出。这种方法使得选中的单词数量能够根据下一个单词的概率分布动态地增加或减少。特别地,当P值为1时,Top-P会选择所有单词,相当于从整个分布中抽样,从而产生更加多样的输出;而当P值为0时,Top-P仅选择概率最高的单词,类似于贪婪解码,使输出更加集中和一致。这三个参数共同作用,影响模型的行为。例如,当设置Temperature=0.8、Top-K=36以及Top-P=0.7时,模型首先基于上下文计算整个词汇表的完整非规范化对数概率分布。Temperature=0.8意味着每个对数概率除以0.8,这在归一化前有效地增加了模型对其预测的信心。Top-K=36表示选择具有最高频比例对数概率的36个标记。接着,Top-P=0.7在这个Top-K=36集合中应用过滤,按概率从高到低保持排序,直到累积概率达到0.7。最后,将这个过滤后的集合重新归一化,用于后续的采样过程。在大模型领域,我们常常会看到诸如 7B、32B、671B 这样的表述,这里的 “B” 是 “billion” 的缩写,意为 “十亿” ,用于量化大模型所包含的参数数量。参数是模型在训练过程中学习和调整的数值,参数规模在一定程度上影响着模型的性能、理解能力与生成能力。通常,参数越多,模型能够学习到的知识和模式就越丰富,理论上在处理复杂任务时表现也会更出色。接下来,为你详细梳理当前主流大模型的参数规模及特点。DeepSeek:参数多元的性能先锋DeepSeek 拥有多个版本,不同参数规模满足多样场景需求。轻量级版本:像 DeepSeek-R1-7B(70 亿参数),是轻量级代表,适合移动设备或边缘计算场景,在实时对话、简单问答等资源受限场景中,响应快速且部署成本低。企业级应用版本:DeepSeek-R1-13B(130 亿参数)和 DeepSeek-R1-14B(140 亿参数)在性能和资源消耗间取得平衡,可处理较复杂任务,无论是企业日常办公还是特定领域应用,都能较好兼顾。高性能版本:DeepSeek-R1-32B(320 亿参数)和 DeepSeek-R1-35B(350 亿参数)拥有更强的表示能力,在复杂推理、多步逻辑处理上优势明显,适用于高性能服务器或云端部署,应对高复杂度任务。旗舰级版本:DeepSeek-V3(6710 亿参数)采用混合专家(MoE)架构,为满血旗舰版,专为复杂推理、数学运算、代码生成等高难度任务设计,支持思维链推理,性能接近 GPT-4 等顶级模型,但需要专业服务器集群支持。蒸馏版本:DeepSeek-R1-Distill 蒸馏版,参数覆盖 1.5B 至 70B,基于开源模型微调,硬件需求低,便于本地部署。ChatGPT:行业标杆的参数演进ChatGPT 背后的 GPT 系列模型,随着版本迭代参数规模不断扩大。早期探索:GPT-1 包含 1.1 亿参数,基于 Transformer 架构,能生成连贯文本,但在复杂上下文理解和逻辑推理上存在局限。能力提升:GPT-2 参数增加到 15 亿,生成文本质量和多样性显著提高,可用于高质量文本生成和创意写作。里程碑式突破:GPT-3 参数达 1750 亿,无需专门微调即可执行多种自然语言处理任务,语言理解和生成能力大幅提升。后续的 ChatGPT-3.5、GPT-4 以及 ChatGPT-4-O 等版本,参数规模进一步增加,不断优化上下文理解、任务泛化能力,甚至引入多模态处理能力。通义千问:参数丰富的全能选手通义千问拥有从低到高不同参数规模的模型。轻量级模型:如 Qwen1.5-0.5B(5 亿参数)和 Qwen1.5-1.8B(18 亿参数),属于轻量级,可在资源有限设备上运行,处理简单语言任务。中等规模模型:Qwen1.5-4B(40 亿参数)具备一定推理能力,可用于文本摘要、简单语言推理等中等规模任务。大规模模型:Qwen1.5-7B(70 亿参数)、Qwen1.5-14B(140 亿参数)等在语言理解、生成和推理方面表现出色。而 Qwen1.5-72B(720 亿参数)和 Qwen1.5-110B(1100 亿参数)更是性能强大,在多项基准测评中成绩卓越。此外,Qwen2 系列以及视觉推理等模型,也在各自领域发挥着重要作用。华为盘古:多元架构的实力担当华为盘古大模型在不同领域发挥优势。超大规模模型:盘古 Ultra MoE 拥有 7180 亿参数,是混合专家模型(MoE),基于昇腾全栈软硬件协同研发,可处理复杂大规模任务。优化适配模型:盘古 Pro MoE(72 亿参数)为 MoE 架构,针对昇腾 300I Duo 芯片优化设计,适用于企业级应用。领域专用模型:盘古 CV 大模型(300 亿参数)用于计算机视觉,盘古 NLP 7B 小模型(7 亿参数)则用于自然语言处理领域。Llama:开源生态的参数矩阵Llama 系列模型推出多个参数版本。初代版本:Llama-1 有 7B、13B、30B 和 65B 四个参数量版本,在超过 1T token 的语料上预训练,采用基于解码器架构。升级版本:Llama-2 有 7B、13B、34B 和 70B 四个参数量版本,预训练语料扩充到 2T token,上下文长度翻倍。专业版本:Code-Llama 专注代码生成,同样有 7B、13B、34B 和 70B 四个参数量版本。新一代版本:Llama-3 有 8B 和 70B 两个参数量版本,支持 8K 长文本,性能优异。大模型的参数规模是其能力的重要体现,但并非唯一决定因素。模型的性能还受训练数据、算法架构、优化策略等多种因素影响。随着技术发展,未来还会有更多不同参数规模、性能卓越的大模型涌现,持续推动人工智能领域的进步。以上便是主流大模型的参数汇总与介绍,希望能为你带来有价值的信息。若你对某类模型还有更深入的疑问,或是想了解其他相关内容,欢迎随时和我说!编辑分享我要在华为云官网发博客,把以上的内容给我扩充下,在前文把B的含义尽可能的说清楚,参数量含义说清楚,同时对列出的几个模型的所有分类,包括蒸馏版本都累出来,已完成思考大模型参数规模解析:从 “B” 到性能的深度解读一、参数规模的核心概念与技术内涵在人工智能领域,“B” 是 “Billion” 的缩写,代表十亿级参数量,这是衡量大模型复杂度的核心指标。参数本质是神经网络中的可调节权重与偏差,它们通过学习海量数据中的模式,决定了模型的信息处理能力。例如,一个 32B(320 亿)参数的模型意味着其内部包含 320 亿个可优化的数值变量,这些变量在训练过程中动态调整,以实现对文本、图像等多模态数据的理解与生成。参数规模直接影响模型的三个关键能力:知识储备量:10-50B 级模型可处理基础逻辑推理,而 100B + 级模型能记忆复杂概念并提供细粒度解释。例如,GPT-3(175B)能生成连贯的技术文档,而 DeepSeek-R1-671B(6710 亿)可解析高等数学问题。推理复杂度:参数越多,模型越擅长因果推理、数学计算等任务。如 Qwen1.5-72B(720 亿)在 MATH-500 基准测试中 Pass@1 达 94.3%,远超 7B 模型的 82%。计算资源需求:100B 级模型通常需要数十张 A100 GPU 支持推理,而轻量级模型(如 7B)可在普通服务器运行。华为盘古 Pro MoE(720 亿)通过昇腾芯片优化,单卡推理速度达 1148 tokens/s,显著优于同类模型。二、主流大模型参数矩阵与技术演进以下从参数规模、架构创新、应用场景三个维度,系统梳理 DeepSeek、ChatGPT、通义千问、华为盘古、Llama 五大模型家族的全系列版本:(一)DeepSeek:参数多元的性能先锋旗舰架构:DeepSeek-V3(6710 亿参数):采用混合专家(MoE)架构,每个 Token 激活约 37B 参数,支持思维链推理,数学能力接近 GPT-4。DeepSeek-R1 系列:R1-7B(70 亿):轻量级版本,适合边缘计算,响应速度达 60 tokens/s。R1-32B(320 亿):企业级推理模型,AIME 2024 基准测试 Pass@1 达 72.6%。R1-671B(6710 亿):满血版需专业服务器集群,数学性能超越 Llama3-70B。蒸馏优化:R1-Distill:基于 Qwen/Llama 架构的蒸馏模型,参数覆盖 1.5B-70B。例如:Qwen-32B(320 亿):数学推理能力媲美 DeepSeek-R1,INT8 量化后精度与 FP8 持平。Llama-8B(80 亿):通用推理模型,适合代码生成与多语言任务。(二)ChatGPT:行业标杆的参数演进基础版本:GPT-1(11 亿):Transformer 架构雏形,仅支持基础文本生成。GPT-3(1750 亿):首次实现零样本学习,参数量是 GPT-2 的 116 倍。优化版本:ChatGPT-3.5:在 GPT-3 基础上增加参数,上下文理解能力提升 30%。GPT-4:参数规模未公开,但引入多模态处理,支持图像输入与复杂逻辑。蒸馏应用:RM 模型(6 亿参数):GPT-3 的蒸馏版本,用于奖励模型训练,提升对话对齐度。(三)通义千问:参数丰富的全能选手Qwen1.5 系列:0.5B-110B:覆盖轻量级到千亿级,支持 32K 上下文。例如:Qwen1.5-72B(720 亿):基于 3T tokens 训练,长文本处理能力突出。Qwen1.5-110B(1100 亿):首个千亿开源模型,MMLU 测评超越 Llama2-70B。Qwen2 系列:0.5B-72B:引入 GQA 机制,支持 128K 上下文。例如:Qwen2-72B(720 亿):性能超过 Llama3-70B,完美处理 128K 信息抽取。Qwen3 系列(2025 年 4 月发布):0.6B-235B:支持 119 种语言,基于 36T tokens 训练,旗舰模型 Qwen3-235B-A22B 在编码、数学任务中对标 GPT-4。(四)华为盘古:多元架构的实力担当超大规模模型:盘古 Ultra MoE(7180 亿):MoE 架构,昇腾全栈协同优化,支持复杂科学计算。盘古 Pro MoE(720 亿):激活参数 160 亿,昇腾 300I Duo 单卡推理速度达 1148 tokens/s,开源推理代码支持私有化部署。领域专用模型:盘古 CV 大模型(300 亿):视觉 MoE 架构,融合红外 / 激光点云数据,用于工业质检。盘古 NLP 7B(7 亿):支持百万级上下文,通过渐进式 SFT 提升垂直领域适配性。轻量优化:盘古 Embedded 7B(70 亿):昇腾 NPU 深度优化,AIME 基准测试超越 Qwen3-8B,支持快速响应与高质量推理动态切换。(五)Llama:开源生态的参数矩阵Llama-1/2 系列:7B-70B:Llama-2 预训练数据增至 2T,上下文长度翻倍至 4096,Code-Llama 专注代码生成。Llama-3 系列:8B-405B:Llama-3.1 8B(80 亿):采用 128K 词表,GQA 优化推理效率,性能超越同等开源模型。Llama-3.1 405B(4050 亿):参数规模对标 GPT-4,支持 128K 上下文,在 150 + 数据集测试中表现接近闭源模型。蒸馏实践:Llama3.2 1B(10 亿):通过知识蒸馏将 Llama3.1 8B 压缩,在 Alpaca 指令任务中性能恢复率超 90%。三、参数规模的应用场景与选型策略轻量级部署(1B-10B):场景:移动端应用、实时对话、边缘计算。推荐:DeepSeek-R1-7B(70 亿)、盘古 NLP 7B(7 亿),响应速度达 60 tokens/s,部署成本降低 80%。企业级推理(30B-100B):场景:金融风控、医疗诊断、代码生成。推荐:Qwen2-72B(720 亿)、Llama3.1 70B(700 亿),数学推理精度超 94%,支持多语言任务。复杂任务处理(100B+):场景:科学研究、多模态生成、超大规模数据解析。推荐:DeepSeek-V3(6710 亿)、盘古 Ultra MoE(7180 亿),MoE 架构支持稀疏激活,算力利用率提升 3 倍。四、华为云与参数优化的深度结合华为云通过昇腾芯片 + 盘古模型的软硬协同,为参数优化提供独特优势:MoGE 架构:盘古 Pro MoE(720 亿)采用分组混合专家模型,跨设备负载均衡,推理性能提升 6-8 倍。量化技术:OptiQuant 算法实现 INT8 量化精度与 FP8 持平,降低 50% 存储成本。开源支持:盘古 Pro MoE 推理代码已开源,支持在昇腾 300I Duo 服务器上实现低成本私有化部署。这是Transformer架构大模型的结构超参数汇总表,这些术语的含义如下一、表格里缩写的含义L:是Number of Layers,即Transformer的层数(解码器/编码器的总层数),代表网络堆叠了多少个Transformer基础模块,层数越多模型的表达能力通常越强。H:是Number of Attention Heads,即注意力头的数量,Transformer的多头注意力机制会把隐状态拆分给多个独立的注意力头分别学习,多头数量就是这个值。PE:是Positional Encoding,即位置编码。Transformer本身没有序列位置信息,需要位置编码给输入注入位置顺序信息,图里不同模型用了不同的位置编码方案:比如Learned(可学习位置编码)、RoPE(旋转位置编码,LLaMA等主流模型常用)、ALiBi、相对位置编码等都是不同的位置编码类型。MCL:是Maximum Context Length,即最大上下文长度,代表这个模型一次能处理的最大序列(输入+输出)token数量,比如2048代表最多处理2048个token,4096就是支持4096token的上下文,数值越大模型能处理的长文本能力越强。补充表格里其他常见词:d_model是模型隐藏层的维度,代表每个token输出的特征维度,和模型整体参数量正相关;#H和d_model满足d_model = #H * 每个注意力头的维度。二、大模型的分类:encoder/decoder的含义这是基于Transformer架构,按照结构对大模型做的分类: Transformer的基础结构包含两个核心模块:编码器(Encoder)(双向注意力,可以同时看到序列里所有位置的token)、解码器(Decoder)(带掩码的单向注意力,生成每个位置token时只能看到这个位置之前的token,保证自回归生成的合理性)。按照结构可以分为三类:仅Decoder(Causal decoder,也就是表格里的这类,你说的decoder) 这是当前生成式大语言模型最主流的架构,比如GPT系列、LLaMA、PaLM都属于这类。 整个模型只有因果解码器(Causal Decoder),没有编码器部分,天生适合自回归文本生成(逐字输出内容),能力侧重文本生成、通用语言理解,是现在ChatGPT类开源大模型的主流结构。仅Encoder(Encoder-only) 整个模型只有编码器结构,代表是BERT系列模型。 用双向注意力建模,更适合做理解类任务,比如文本分类、命名实体识别、情感分析,不擅长开放式文本生成,现在很少用作通用大生成模型的基座。Encoder-Decoder(编码器-解码器架构,也就是表格里T5所属的类别) 同时包含编码器和解码器两部分,代表是T5、BART,早期的翻译、摘要模型常用这种结构。 编码器处理输入文本,解码器生成输出文本,兼顾编码输入和生成输出,现在也有不少大模型用这个架构,不过流行度低于纯Decoder架构。另外表格里还有一个Prefix decoder(前缀解码器,也叫前缀LM),是编码器解码器结构的变体,GLM、谷歌T5也有用这种设计:它仅对输入前缀做双向注意力,输出部分依然用单向因果注意力,兼顾了双向编码输入和生成的能力,参效率比传统Encoder-Decoder更优。来自:https://cloud.tencent.com/developer/article/2424058
2026年04月10日
28 阅读
0 评论
0 点赞
2026-04-09
AI专题六:主流的大模型分类
一、按架构类型分类架构类型特点代表模型Decoder-only(自回归)从左到右生成,适合文本生成GPT-4、Claude、LLaMA、Qwen、ChatGLMEncoder-only(双向编码)双向理解,适合分类/理解任务BERT、RoBERTa、ERNIE(早期)Encoder-Decoder(序列到序列)编码器+解码器,适合翻译/摘要T5、BART、GLM(清华)、UL2当前趋势:Decoder-only占据主导(GPT系列成功带动),Encoder-Decoder仍有特定场景应用。二、按模态类型分类大语言模型(LLM)- 纯文本类型商业模型开源模型通用对话GPT-4/4o、Claude 3.5、Gemini、Kimi、文心一言、通义千问LLaMA 3、Qwen 2.5、Mistral、DeepSeek-V3、ChatGLM3、Yi代码专用GitHub Copilot、CursorCodeLLaMA、DeepSeek-Coder、StarCoder、WizardCoder推理专用OpenAI o1/o3、Claude 3.5 Sonnet (Thinking)DeepSeek-R1、Qwen-QwQ、Marco-o1多模态大模型(MLLM)- 文本+图像/视频/音频模态组合代表模型文本+图像GPT-4V、Claude 3、Gemini、Qwen-VL、LLaVA、CogVLM、InternVL文本+视频Sora、Runway Gen-3、可灵、Pika、VideoPoet文本+音频GPT-4o(原生多模态)、Qwen-Audio、SpeechGPT全模态统一GPT-4o、Gemini 1.5 Pro、Qwen2.5-Omni视觉大模型类型代表模型图像理解/分割SAM 2(Meta)、CLIP(OpenAI)、EVA、InternViT图像生成DALL-E 3、Midjourney、Stable Diffusion 3、FLUX、Imagen视频生成Sora、可灵、Runway、Pika、CogVideo语音大模型类型代表模型语音识别Whisper(OpenAI)、FunASR(阿里)语音合成VALL-E、Voicebox、CosyVoice语音对话GPT-4o Voice、豆包语音、MiniMax语音大模型三、按应用领域分类领域代表模型/系统科学计算AlphaFold 3(蛋白质结构)、GraphCast(天气预报)、DeepMind材料发现模型数学推理OpenAI o1、DeepSeek-R1、Qwen2.5-Math、NuminaMath法律通义法睿、ChatLaw、PowerLawGLM医疗Med-PaLM 2、HuatuoGPT、扁鹊、BioGPT金融BloombergGPT、FinGPT、度小满轩辕教育Khanmigo(可汗学院)、松鼠AI大模型编程/软件GitHub Copilot、Devin、Cursor、通义灵码四、按训练方法/特性分类类型说明代表预训练大模型基础模型,需微调GPT-3、LLaMA 2、BERT指令微调模型(IFT)对齐人类指令ChatGPT、Alpaca、VicunaRLHF对齐模型基于人类反馈强化学习GPT-4、Claude、InstructGPTMoE架构模型混合专家,稀疏激活GPT-4(推测)、Mixtral 8x7B/8x22B、DeepSeek-V3、Qwen1.5-MoERAG增强模型结合外部知识检索多数现代模型都支持Agent模型具备工具调用/自主规划AutoGPT、GPT-4 with Tools、Claude with Computer Use、智谱AutoGLM五、开源 vs 商业 一览主流开源大模型(可免费使用/部署)机构模型系列特点MetaLLaMA 3(8B/70B/405B)开源可商用,社区生态最大阿里Qwen 2.5(0.5B-72B)、Qwen-VL、Qwen-Audio中文最强开源,多模态全面DeepSeekDeepSeek-V3、DeepSeek-R1性能接近GPT-4,成本极低MistralMistral 7B、Mixtral 8x7B/8x22B、Mistral Large欧洲最强,MoE架构智谱AIChatGLM3/4、GLM-4-9B中文友好,学术开源零一万物Yi-1.5(6B/9B/34B)李开复团队,长文本优秀百川智能Baichuan 2中文开源,商用友好Stability AIStable LM、Stable Diffusion图像生成领域开源标杆Hugging FaceBLOOM、Zephyr、StarCoder社区驱动,多语言支持GoogleGemma(2B/7B/9B/27B)轻量级开源,可端侧部署主流商业大模型(API/闭源)公司模型特点OpenAIGPT-4o、GPT-4 Turbo、o1/o3全球最强通用模型AnthropicClaude 3.5 Sonnet/Haiku/Opus长文本、安全性突出GoogleGemini 1.5 Pro/Flash/Ultra原生多模态,长上下文(200万token)月之暗面Kimi K1.5中文长文本(200万字)领先百度文心一言 4.0、文心大模型中文知识增强阿里通义千问 Max、Qwen-Turbo开源+商业双轨字节跳动豆包大模型、云雀多模态,C端产品强腾讯混元大模型中文语境优化MiniMaxabab 6.5、海螺AI语音多模态商汤日日新 SenseNova视觉多模态强六、技术趋势总结趋势说明多模态统一从文本→图文→音视频→全模态(GPT-4o方向)端侧小模型手机/PC本地运行(Gemma、Phi-3、Llama 3.2 1B/3B)MoE架构普及用稀疏激活降低推理成本(Mixtral、DeepSeek-V3)推理能力强化o1/R1类"慢思考"模型,专门优化逻辑推理Agent化从对话工具向自主任务执行演进开源追赶闭源DeepSeek-R1、Qwen2.5等已接近GPT-4水平七 chagpt5 ,deepseek v3.2, 豆包 属于哪一类大模型这三个模型都属于大语言模型(LLM)的范畴,但各有细分特点:模型公司架构类型核心定位突出特点GPT-5OpenAIDecoder-only通用AGI助手多模态原生、推理能力、Agent执行DeepSeek V3.2DeepSeekDecoder-only (MoE)开源高性能极致性价比、代码/数学强、低成本豆包字节跳动Decoder-onlyC端AI助手中文优化、语音交互、多模态内容创作详细分类GPT-5(OpenAI)维度说明类型通用大语言模型(闭源商业)架构Decoder-only,推测继续沿用MoE模态原生多模态(文本+图像+音频+视频统一)特色能力高级推理(o系列技术融合)、自主Agent执行、深度研究定位当前全球最强通用模型,追求AGIDeepSeek V3.2(深度求索)维度说明类型通用大语言模型(开源可商用)架构Decoder-only + MoE(混合专家)参数规模总参数量大,但推理时只激活部分专家(节省算力)突出优势代码生成、数学推理、中文能力、API成本极低定位"开源版GPT-4",性价比之王豆包(字节跳动)维度说明类型通用大语言模型 + C端AI助手产品架构Decoder-only(基于云雀模型)产品形态App + 网页 + API + 嵌入抖音/飞书生态突出优势语音交互自然、中文语境理解、内容创作(文案/脚本/视频)、年轻化表达定位中国C端用户量最大的AI助手之一八 chagpt5 属于LLM,为什么又是多模态呢? LLM 不是用来处理语言的?LLM(大语言模型)的定义正在扩展——从"纯文本模型"演变为"以语言为核心接口的多模态模型"。GPT-5这类模型虽然叫"语言模型",但实际上已经突破了纯文本的边界。概念的演变传统定义(早期)LLM = Large Language Model = 纯文本大模型 ↓ 输入:文本 输出:文本 代表:GPT-3、早期BERT 当前定义(2024-2025)LLM = 以"语言"为主要交互接口的大模型 ↓ 输入:文本 / 图像 / 音频 / 视频 处理:统一语义空间理解 输出:文本 / 图像 / 音频 / 视频 代表:GPT-4o、GPT-5、Gemini、Claude 3.5、Qwen2.5-Omni 为什么还叫"LLM"而不是"MM"?原因解释语言是核心接口无论输入什么模态,最终都用"语言"来推理、规划、输出训练基础仍是语言模型核心能力建立在海量文本预训练之上历史命名惯性从GPT-3→GPT-4V→GPT-4o一脉相承,用户认知度高技术实现角度底层仍是Transformer架构,只是输入编码器扩展了GPT-5的多模态是如何实现的?┌─────────────────────────────────────────┐ │ 用户输入(多模态) │ │ 文本 / 图像 / 音频 / 视频 / 文件 │ └─────────────────────────────────────────┘ ↓ ┌─────────────────────────────────────────┐ │ 统一编码器(Tokenizer) │ │ • 文本 → Token IDs │ │ • 图像 → Visual Patches(图像块) │ │ • 音频 → Spectrogram Tokens │ │ • 视频 → 时空Visual Patches │ └─────────────────────────────────────────┘ ↓ ┌─────────────────────────────────────────┐ │ 统一Transformer架构(核心LLM) │ │ 所有模态在同一个语义空间处理 │ └─────────────────────────────────────────┘ ↓ ┌─────────────────────────────────────────┐ │ 输出生成(多模态) │ │ 文本 / 图像 / 音频 / 视频 │ └─────────────────────────────────────────┘关键点:所有模态最终被编码为类似"token"的离散单元,用同一套LLM架构处理。更准确的分类术语为避免混淆,学术界/工业界出现了更精确的术语:术语全称含义代表LLMLarge Language Model纯文本或以文本为主的模型GPT-3、LLaMA 2VLMVision-Language Model视觉-语言模型LLaVA、CogVLMMLLMMultimodal Large Language Model多模态大语言模型GPT-4V、Qwen-VLLMMLarge Multimodal Model大型多模态模型(更通用)GPT-4o、GeminiFoundation Model基础模型泛指所有大规模预训练模型所有上述模型GPT-5的准确分类:MLLM(多模态大语言模型) 或 LMM(大型多模态模型)一句话总结问题答案LLM不是只处理语言吗?传统是,但现在LLM的概念已扩展,GPT-5这类模型本质是以语言为核心的多模态模型为什么还叫GPT(Generative Pre-trained Transformer)?品牌延续性 + 技术架构未变(仍是Transformer)+ 语言仍是核心交互方式更准确的叫法?MLLM(多模态大语言模型) 比纯 LLM 更准确
2026年04月09日
45 阅读
0 评论
0 点赞
2026-04-09
AI专题五: NLP模型 与 LLM(大语言模型)
LLM是NLP模型的一种,是NLP发展到当前阶段的"终极形态"。NLP模型(自然语言处理模型) ├── 传统NLP模型(基于规则/统计) │ ├── 规则系统(正则表达式、专家规则) │ ├── 统计模型(HMM、CRF、n-gram语言模型) │ └── 传统机器学习(SVM、朴素贝叶斯等) │ ├── 深度学习NLP模型(神经网络时代) │ ├── RNN/LSTM/GRU(序列建模) │ ├── CNN(TextCNN等,用于分类) │ ├── Seq2Seq + Attention(机器翻译) │ └── Transformer(BERT、GPT系列) │ └── 大语言模型 LLM(当前阶段) ├── encoder-only(BERT、RoBERTa)← 理解任务 ├── decoder-only(GPT系列、LLaMA、Claude)← 生成任务 └── encoder-decoder(T5、BART)← 翻译/摘要自然语言处理(NLP)是一个涵盖人类语言全场景处理的技术领域,其范畴包括所有用于理解、分析、生成人类语言的模型与技术,小到简单的关键词提取,大到复杂的对话系统构建,均属于NLP的研究与应用范畴。而大型语言模型(LLM)则是NLP领域内的一类特定模型,是近年来NLP技术发展的重要成果之一。从能力边界来看,LLM凭借其独特的设计逻辑,已展现出“通才”属性——能够应对几乎所有经典NLP任务,无论是文本分类、机器翻译,还是情感分析、摘要生成,都能通过其对语言模式的深度理解完成任务。这种适应性源于LLM的预训练机制:通过海量文本数据学习通用语言规律,无需针对单一任务进行专门的模型重构,这与传统NLP中“一事一模型”的模式形成鲜明对比。但需明确的是,LLM并非NLP任务的“万能解”。在某些需要高度专业化、狭义化解决方案的场景中,LLM的表现反而不如专门优化的传统NLP模型 。例如,在工业级的法律条款精准提取任务中,针对法律文本特征定制的规则式NLP模型,准确率和效率会优于通用LLM;在低资源语言的方言识别任务中,小型定制化模型也可能比LLM更具成本优势。从实际应用视角看,LLM的任务覆盖范围与传统NLP技术存在“交集但非完全重合”的关系:LLM的多功能性使其能替代部分传统模型,但传统NLP模型在特定细分场景的“专精性”,仍是LLM短期内难以完全取代的。NLP技术的发展历程中,形成了多元且分层的技术体系,涵盖从基础到复杂的多种方法:• 基础层:基于规则的方法(如正则表达式匹配、语法规则解析),适用于简单的文本过滤、关键词提取等任务;• 中间层:传统机器学习方法(如支持向量机、朴素贝叶斯),需结合人工特征工程,用于文本分类、情感倾向判断等场景;• 高级层:深度学习方法(如循环神经网络RNN、卷积神经网络CNN),通过自动学习文本特征,提升复杂任务的处理能力,常见于命名实体识别、语义角色标注等任务。这些技术各有适用场景,例如在处理结构化文本(如表格型数据中的信息提取)时,基于规则的NLP方法仍能高效发挥作用。LLM的技术路径高度聚焦于深度学习框架下的Transformer架构,其核心创新点在于“自注意力机制”:通过计算句子中每个词语与其他词语的关联权重,动态判断不同词语在语境中的重要性,从而实现对文本上下文的精准理解。例如,在处理“苹果发布了新款手机”与“我吃了一个苹果”时,自注意力机制能区分“苹果”在不同语境中的指代(公司/水果),这是传统NLP模型难以高效实现的。此外,LLM的技术流程呈现“预训练-微调”的特点:先在海量通用文本(如网页、书籍、论文)上完成预训练,构建通用语言认知能力;再根据具体任务(如医疗文本问答)的小样本数据进行微调,快速适配特定场景。这种模式大幅降低了对单一任务数据量的依赖,也是其技术优势的重要来源。
2026年04月09日
30 阅读
0 评论
0 点赞
1
...
3
4
5
6