ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

《生成式人工智能与机器学习导论 2025》第 3 讲 - 学习笔记1

《生成式人工智能与机器学习导论 2025》第 3 讲 - 学习笔记1 《生成式人工智能与机器学习导论 2025》第 3 讲-学习笔记1. LLM生成文字的整体流程大型语言模型Large Language Model, LLM生成文本时并不是直接“理解问题并写答案”而是通过多层神经网络逐步转换表示最终预测下一个 Token。整体流程文字输入 ↓ Tokenization ↓ Token ID ↓ Embedding ↓ Transformer Layers ↓ Hidden Representation ↓ LM Head ↓ Probability Distribution ↓ 预测下一个 Token ↓ 循环生成核心思想LLM本质上是在当前上下文条件下不断计算下一个Token出现概率的模型。2. Tokenization分词2.1 为什么需要Tokenization计算机无法直接处理文字只能处理数字。因此需要把自然语言转换成模型可以计算的基本单位TokenToken可能是一个单词一个汉字一个词的一部分标点符号例如输入artificial intelligence可能转换为art ificial intelligence2.2 为什么不用完整单词如果一个词对应一个Token词汇表会非常巨大新词无法处理拼写变化难以覆盖因此现代LLM通常采用Subword Tokenization子词分割例如unbelievable可以拆成un believe able这样模型可以组合理解未见过的新词。3. Token ID数字编号Token仍然是文字神经网络无法直接处理。因此每个Token会对应一个编号例如法国 → Token ID 39872 首都 → Token ID 58291输入法国的首都是可能转换为[39872, 102, 58291, 76]注意Token ID只是编号没有数学意义。例如法国 39872 德国 56321并不表示德国比法国“大”。4. Embedding词向量表示4.1 Token ID如何变成语义Token ID只是数字。模型需要将它转换为连续向量例如法国 ↓ [0.21, -0.35, 0.67, ...]这个过程叫Embedding4.2 Embedding矩阵假设词表大小128256Hidden Size4096那么Embedding矩阵128256 × 4096每一行代表一个Token的向量。4.3 Embedding表示什么Embedding表示Token本身的语义特征例如巴黎可能包含城市概念法国相关地理信息语言关系特点静态同一个Token永远相同例如两个句子中的bankEmbedding相同。5. Transformer LayersTransformer层Embedding只是Token的初始表示。模型还需要理解上下文。例如I deposited money in the bank.和I sat on the river bank.两个bank含义不同。Transformer负责根据上下文调整Token表示。6. Transformer内部结构一个Transformer Layer主要包含Input ↓ Self-Attention ↓ Feed Forward Network ↓ Output7. Self-Attention自注意力机制Self-Attention解决当前Token应该关注哪些其他Token例如小明去银行取钱因为他需要现金。模型需要知道“他”指的是“小明”。Attention会计算Token之间的重要程度。核心计算Attention(Q,K,V)softmax(QKT/d)V Attention(Q,K,V)softmax(QK^T/\sqrt d)VAttention(Q,K,V)softmax(QKT/d​)V其中Query我需要寻找什么信息Key我有什么信息Value实际提供的信息8. Feed Forward Network前馈网络Attention负责信息交流Feed Forward负责对信息进一步加工例如输入法国 首都模型逐渐形成法国 → 国家 首都 → 城市关系 巴黎 → 可能答案9. Hidden Representation隐藏表示经过多层Transformer后Token会得到新的向量表示。例如h [ 0.32, -0.56, 0.91, ... ]这个向量称为Hidden Representation9.1 Embedding和Hidden Representation区别虽然维度通常相同例如Embedding: 4096维 Hidden Representation: 4096维但是意义不同。阶段含义EmbeddingToken自身的语义Hidden Representation结合上下文后的动态语义9.2 Hidden Representation是动态的例如Tokenbank句子1money in the bank句子2river bankEmbedding相同Transformer之后Hidden Representation不同因为上下文不同。10. Embedding维度和Hidden维度关系现代LLM通常Embedding Dimension Hidden Size例如Llama类模型4096维流程Token ↓ Embedding 4096维 ↓ Transformer 4096维 ↓ Hidden Representation 4096维原因Transformer设计为保持输入维度 输出维度11. LM Head语言模型输出层Transformer输出的是Hidden Vector例如4096维但是模型需要回答下一个Token是什么因此需要LM Head。11.1 LM Head作用LM Head将4096维Hidden State转换为128256个Token的分数数学形式zWhb zWhbzWhb其中hHidden RepresentationWLM Head权重zLogits11.2 LM Head矩阵尺寸假设Vocabulary128256Hidden Size4096则W128256×4096 W128256\times4096W128256×4096计算128256 × 4096得到128256个Logits每个Logit代表一个Token出现的可能性评分。12. Probability概率分布Logits不是概率。需要通过Softmax转换例如输入巴黎 12.5 伦敦 8.2 东京 6.7输出巴黎 92% 伦敦 5% 东京 2%形成整个词表上的概率分布。13. 预测下一个Token模型选择概率最高的Token输入法国的首都是输出巴黎得到法国的首都是巴黎14. 自回归生成Autoregressive GenerationLLM不是一次生成完整句子。而是一次预测一个Token。过程输入 ↓ 预测Token1 ↓ 加入输入 ↓ 预测Token2 ↓ 加入输入 ↓ 继续循环直到生成结束Token达到最大长度15. Weight Tying权重共享很多现代LLM会让输入Embedding矩阵和输出LM Head矩阵共享参数。目的让输入和输出使用同一个语义空间。15.1 为什么可以共享输入Token ↓ Embedding ↓ 语义向量输出Hidden State ↓ 寻找最匹配Token二者本质都是Token与语义向量之间的映射。15.2 为什么有时写WEᵀ原因是矩阵定义方向不同。方式1EmbeddingE∈R128256×4096 E \in R^{128256 \times 4096}E∈R128256×4096那么WE WEWE方式2EmbeddingE∈R4096×128256 E\in R^{4096\times128256}E∈R4096×128256那么WET WE^TWET因此转置不是核心。核心是输入Embedding和输出预测共享同一套Token语义表示。16. 完整流程总结文字输入 ↓ Tokenization 把文字切成Token ↓ Token ID 转换为数字编号 ↓ Embedding Token ID → 语义向量 ↓ Transformer Layers 通过Attention和FFN理解上下文 ↓ Hidden Representation 形成当前上下文的内部表示 ↓ LM Head Hidden Vector → 所有Token评分 ↓ Softmax 评分 → 概率 ↓ 预测Token 选择最高概率Token ↓ 循环生成核心理解大型语言模型并不是输入问题 ↓ 搜索答案 ↓ 输出答案而是输入文字 ↓ 转换为向量 ↓ 多层Transformer逐步提取上下文信息 ↓ 形成隐藏表示 ↓ 计算每个Token概率 ↓ 逐个生成文本研究LLM内部机制的关键问题就是Hidden Representation中到底编码了什么信息Transformer不同层如何形成语言理解、知识和推理能力
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表