ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪

玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪 玩转大模型 第一篇认识大模型——它到底是什么、能干什么、开源和闭源差在哪这两年只要跟技术沾边的场合大模型三个字几乎绕不过去。DeepSeek、通义千问、GPT、Gemini、Claude……名字一个比一个响宣传口径也大同小异参数很大、能力很强、什么都懂一点。但真要把这些东西讲清楚很多人会卡在几个很基础的问题上所谓7B“36T token”“5 PFLOPS到底在说什么为什么有的模型能看图有的只能写字同样是开源”为什么有人说开源模型免费有人说自己部署一台机器比 API 贵得多这篇文章就是把大模型的地基先摊平定义、出现原因、计量单位、分类方式、开源与闭源。后面几篇再往上盖训练、算力和工程落地。1. 大模型到底是什么目前学界和工业界对大模型Large Models并没有一个统一的标准定义。通常的说法是训练数据庞大、参数规模巨大、能力强大的深度神经网络模型。参数量一般在10 亿以上目前顶尖模型的参数规模已经到了万亿级别。下面这张图是几个大家熟悉模型的公开口径感受一下量级差异简单理解传统模型 -- 千万级参数 人工标注的几十万条样本 大模型 -- 百亿~万亿级参数 万亿级 token 的无标注语料关键不在大而在大到一定程度之后能力开始出现质的变化——这也是为什么同一个 Transformer 结构规模上去之后突然会写代码、会做推理。2. 为什么偏偏是这个时间点出现大模型的出现不是偶然而是数据、算力、模型架构三者协同演进的结果。少任何一条都到不了今天。2.1 数据够多训练范式换了传统监督学习高度依赖人工标注数据对原始数据做标记、分类、注释、结构化让机器能识别理解成本高、规模上不去。常见的标注活儿长这样标注类型干什么分类标注给整张图打类别标签比如猫“狗”命名实体识别标出文本里的人名、地名、组织名情感分析标正面 / 负面 / 中性语音转写把语音逐句转成文字大模型主要用自监督学习范式典型任务是预测下一个 token直接拿海量未标注文本和多模态数据训练。自监督本质上属于无监督学习的一种特殊形式但用了监督学习的训练方式靠数据自身的内在结构自动生成伪标签再像监督那样训练不依赖人工标注。掩码语言建模就是典型例子。量级差别有多大Qwen3 预训练阶段用了约36T个 token 的语料这个规模远超传统机器学习时代的训练数据总量。2.2 算力够强并行硬件 分布式训练成熟深度学习的训练本质是大规模矩阵运算这类计算高度并行和 GPU/TPU 的硬件架构天然契合。单卡算力方面英伟达 最新一代B200在FP16半精度浮点数条件下峰值算力已达5 PFLOPS约每秒 5×10¹⁵ 次浮点运算单位换算1 P 10 3 T 10 6 G 10 9 M 10 12 K 10 15 1P10^{3}T10^{6}G10^{9}M10^{12}K10^{15}1P103T106G109M1012K1015。与此同时三种分布式训练体系已经成熟让跨节点、跨集群训练超大规模参数模型变成现实数据并行每张卡都放完整模型副本各自处理不同数据子集靠梯度聚合把参数更新同步 张量并行把权重矩阵按维度切开每张卡只算自己那一片再用集合通信把结果拼起来 流水线并行按层或模块切成若干阶段每个阶段放不同设备数据像流水线一样依次穿过2.3 架构合理Transformer 的可扩展性Transformer 架构天生支持并行计算并且在模型规模、数据规模、训练步数算力开销三个方向同时加大时性能收益是稳定的——也就是所谓的良好可扩展性Scaling Law。图中 Test Loss 是损失函数的取值。补一个概念损失函数Loss Function用来量化模型预测值与真实值之间的差异也叫代价函数或目标函数。它通过计算预测错误程度来评估模型性能值越小越准值越大误差越大。常见的有均方误差MSE、平均绝对误差MAE。2.4 一句话总结数据规模的跃迁 算力基础设施的发展 Transformer 优异的可扩展性三者叠加推动模型规模和性能持续膨胀这才有了大模型时代。3. 三个计量维度B、token、FLOPs 分别在说什么聊大模型最容易搞混的就是单位。其实从三个维度看就清楚了参数规模、训练数据集规模、计算规模。维度衡量什么常用单位举例参数规模模型有多大BBillion10 亿10 9 10^91097B 70 亿参数训练数据集规模喂了多少文本token 数B / T1T token 10 12 10^{12}1012token计算规模训练烧了多少算力FLOPs浮点运算次数1 PFLOPs 10 15 10^{15}1015FLOPs1参数规模这里说的参数是深度神经网络里神经元数量、层数、神经元权重、神经元偏移量、超参数这些数据的集合。2训练数据集规模LLM 的训练在文本语料上进行而语料处理的第一步就是分词成一系列 token所以业界习惯用token 数量来衡量训练数据集规模。多模态模型的数据集格式五花八门无法用统一单位度量这块一般不放在一起讨论。关于 token很多人第一次接触会懵这里单独说一下Q1token 到底是什么token 是计算机理解人类语言的基础单位。它不一定等于一个词可能是一个完整英文单词也可能是半个、甚至三分之一个可能是一个中文词也可能就是一个汉字大模型在正式开训之前要先训练一个tokenizer模型专门负责把所有文本切成 token。粗略的经验值1 个英文字符 ≈ 0.3 个 token 1 个中文字符 ≈ 0.6 个 token想验证的话可以直接用官方的分词器试https://platform.openai.com/tokenizerQ2FLOPs 和 FLOPS 是一回事吗不是。课件里的用法区分是FLOPsFloating Point Operations指浮点运算次数衡量训练消耗的总计算量而硬件指标里的FLOPSPer Second指每秒能完成多少次衡量的是速度。一个是总量一个是速率。4. 大模型怎么分类两个最常用的切分标准按模态输入输出的数据类型和按功能/输出形态模型吐出来的是文字、向量还是分数。分类标准类别示例按模态大语言模型Qwen3 / DeepSeek-V3 / GPT-5 语言模块多模态理解模型Qwen3-VL / GPT-5 / Gemini-3多模态生成模型Stable Diffusion / DALL·E / Nano-Banana按功能生成式大模型GPT-5 / DeepSeek-V3 / Qwen3嵌入模型BGE / E5 / GTE重排序模型BGE-Reranker / ms-marco-MiniLM分类模型通常是微调过的小尺寸模型4.1 按模态分语言 / 多模态理解 / 多模态生成先补一个基础概念模态Modality指的是人或机器感知世界的方式常见的有文本、图像、音频/语音、视频等。类型 1大语言模型LLM又叫语言/文本大模型专门处理文本数据。项目说明输入 → 输出文本 → 文本token 序列技术架构Transformer 文本编码典型应用对话、写作、推理、翻译、代码生成代表Qwen3 系列、DeepSeek-V3.2 系列、GPT-5 系列语言模块、Gemini-3 系列语言模块需要注意一点ChatGPT 和 Gemini 本身不属于上面任何单一类别。它们是以语言大模型为中枢的智能体系统是面向用户推出的 AI 产品支持文本生成、图像理解和图像生成。模型 ≠ 产品这个区分后面讲工程落地时还会反复遇到。类型 2多模态理解大模型能同时处理和理解多种类型的数据文本、图像、音频、视频通过对比学习等技术把不同模态映射到统一语义空间。项目说明输入 → 输出文本 图像/音频/视频 → 通常是文本技术架构多编码器 跨模态融合典型应用看图说话VQA、视频理解、音频理解、文档理解PDF / 表格 / 图像代表GPT-5 系列、Qwen3-VL 系列、Gemini-3 系列类型 3多模态生成模型不光能理解多种模态还能做跨模态内容生成。核心是生成式架构靠扩散模型、自回归生成等技术完成从一种模态到另一种模态的转换。项目说明输入 → 输出文本/图像 → 图像/视频/音频技术架构生成式架构扩散 / 自回归典型应用文生图、文/图生视频、文生音频TTS / Music代表图像Stable Diffusion、DALL·E、GPT-Image-1.5、Nano-Banana视频Sora、Veo音频AudioLM、VALL-E4.2 按功能/输出形态分生成 / 嵌入 / 重排序 / 分类类型 1生成式大模型Generative LLM根据指令或提示从无到有生成原创内容文本、图像、音频、视频。输出token 序列优化目标最大化条件概率 P(token | context)核心特征自回归Autoregressive生成——不断预测下一个 token 来产出内容典型应用对话、推理、Agent、RAG 的最终回答生成代表GPT-5、DeepSeek-V3、Qwen3以及 DALL·E图像、Sora视频类型 2嵌入模型 / 向量表征模型Embedding Model把文本、图像等离散数据转换成高维向量在向量空间里捕捉语义关系。语义相似的文本在向量空间中距离更近因此便于快速检索和比较。输出固定维度的稠密向量dense vector不生成文本典型应用语义搜索、推荐系统、知识库检索、文档相似度计算代表BGE 系列、E5 系列、GTE 系列类型 3重排序 / 相关性打分模型Reranking对初步检索出来的结果做精细化排序通过深度语义分析重新计算查询与文档的相关性得分把最相关的顶到前面。输入(query, doc) 一对 →输出相关性分数scalar典型应用RAG 系统的检索结果优化、搜索引擎排序、推荐系统精排代表BGE-Reranker 系列、Hugging Face 上 Cross-Encoder 组织的 ms-marco-MiniLM 系列Cross-Encoder 是个在 Hugging Face 上训练了很多 Text Reranking 模型的组织类型 4分类器 / 判别模型Classifier根据数据特征预测其所属的预定义类别输出离散的类别标签或概率分布。输出标签 / 概率 / Yes-No典型应用垃圾邮件识别、情感分析、图像分类、疾病诊断等二分类或多分类任务代表通常是微调过的小模型比如基于 BERT 微调的分类模型四者横向对比维度生成式大模型嵌入模型重排序模型分类模型核心任务内容生成语义编码相关性排序类别预测输出形式自然语言/图像/音频高维向量相关性分数类别标签模型规模百亿~千亿参数百万~亿级参数千万~亿级参数百万~千万参数计算成本极高极低中低低典型架构Transformer 解码器Transformer 编码器交叉编码器逻辑回归/SVM/决策树4.3 这四类模型不是竞争关系是流水线这一块是很多人第一次看会漏掉的重点实际系统里四类模型往往协同工作尤其是 RAG 场景。知识库文档 -- 嵌入模型编码成向量 -- 存入向量数据库 ↓ 用户提问 -- 嵌入模型检索候选文档 -- 重排序模型精排 -- 分类模型过滤/判定 -- 生成式大模型输出答案检索Embedding Rerank负责找得准生成LLM负责说得清。这种组合正是 RAG 的标准形态。5. 开源 vs 闭源差别不只是要不要钱5.1 先拆四要素一个大模型由四个要素构成模型权重参数、推理代码、训练代码、训练数据集。四者层次一旦理清就会发现开源这个词的含金量差别很大。需要注意的是大模型的开源和传统软件的开源不是一回事。这里要特别拎一个概念出来严格来说业界大量所谓开源大模型更准确的叫法其实是Open Weight开放权重模型。权重开放 ≠ 推理代码开放 ≠ 训练代码开放 ≠ 训练数据开放 ≠ 可自由商用这几件事完全不是一回事。大模型开源通常只开放权重可能附带推理代码但一般不包含训练代码和数据集。如果涉及企业商业化或私有部署License 一定要单独检查。阵营含义典型代表开源 / 开放权重主要指开放权重模型参数任何人可查看、修改、分发DeepSeek 系列、Qwen 系列、Llama 系列、文心大模型 4.5闭源特定企业开发并保密源代码和内部实现不对外公开GPT 系列早期 GPT-1/GPT-2 和后来开源的 GPT-OSS 系列除外、Gemini 系列大多数、Claude 系列5.2 七个维度的正面对比维度开源大模型闭源大模型透明度代码和算法完全透明可审查验证内部机制不透明存在黑箱问题可访问性免费使用降低技术门槛需要特定许可或授权通常付费定制性支持深度定制和优化定制能力受限仅限 API 参数调整创新速度社区协作推动快速迭代依赖单一团队创新速度较慢成本结构免费使用但需硬件和运维投入按使用量付费前期投入低但长期成本高技术支持依赖社区缺乏官方专业支持提供企业级技术支持和维护服务安全性透明可审计但可能被恶意利用代码不公开保护知识产权和用户数据Q开源不是免费吗为什么常说自建比调 API 贵关键就在成本结构这一行。开源免掉的是模型授权费但权重跑起来要卡、要电、要运维而且推理量小的时候这笔固定投入摊不薄。闭源按 token 付费前期几乎零投入但量级一大长期成本会反超。所以真实分界线通常是调用量和数据能否出内网不是开源省钱、闭源贵这么简单。5.3 各自的商业逻辑开源的商业逻辑技术扩散换取生态影响核心策略用免费厨房模式吸引开发者构建庞大用户生态再通过云服务、工具链、行业解决方案等增值服务盈利变现路径云服务变现、企业级定制、硬件生态、工具链和平台优势快速占领市场、建立行业标准、降低用户采用门槛形成创新飞轮——企业贡献基础模型学术界优化算法开发者创造应用最终反哺模型迭代闭源的逻辑专有技术换取商业利润核心策略用技术垄断建立护城河通过 API 调用、企业级定制方案、云平台集成直接变现盈利模式API 订阅服务、企业级解决方案、技术授权和专利变现、云平台增值服务优势直接盈利能力强、技术溢价高、服务质量稳定、保护知识产权——在短期激烈竞争中能确实拿到利润5.4 混合模式已经是主流随着竞争加剧开源引流、闭源变现成了很多企业的标准打法厂商开源的那一半闭源的那一半谷歌Gemma吸引开发者生态Gemini服务高利润企业客户MetaLlama 系列建生态自研模型用于商业服务阿里巴巴通义千问中国最大的开源模型家族闭源企业级服务百度2025 年 6 月开源文心 4.5 系列闭源 API 服务这种模式既能靠开源快速立生态又能靠闭源保住商业回报目前看是主流解法。最后总结什么是大模型目前没有统一定义经验线是参数量 10 亿以上、顶尖已到万亿级真正的价值不在于大而在于规模上去之后能力出现跃迁。为什么是现在数据自监督范式解放语料规模、算力GPU/TPU 三种并行成熟、架构Transformer 的可扩展性三条同时到位缺一条都起不来。怎么看参数表B说模型多大T token说喂了多少FLOPs说烧了多少算力。三者不要混为一谈。怎么选模型类型日常文本用 LLM要处理图片/视频/音频的理解用多模态理解模型要产出图像视频用多模态生成模型做检索则离不开嵌入 重排序。开源还是闭源真正该关心的是开放到哪一层权重/推理代码/训练代码/数据以及自己的调用量和数据合规要求。对于准备做工程落地的开发者我个人更建议先记住这一句模型 ≠ 产品权重开放 ≠ 自由商用检索和生成是两类模型在协作。第二篇会接着讲这些能力到底是怎么训练出来的——预训练、SFT、RLHF 三阶段各解决了什么问题。参考资料 致谢[1] 尚硅谷大模型技术之大模型概述 V1.0.3-课件[2] Transformer 论文 Attention Is All You Need-arXiv[3] OpenAI Tokenizer-官方工具[4] Qwen 官网[5] DeepSeek 官网[6] NVIDIA 官网[7] Stability AI 官网[8] Hugging Face Cross-Encoder Reranker-模型库[9] Llama 官网[10] Anthropic 官网
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表