1702 字
9 分钟
解密 AI 诞生之路:从模型训练到 Transformer 架构的数学之美

在今天,像 ChatGPT、Claude 这样的生成式 AI 已经深入我们的生活与工作。你是否好奇过,这背后动辄千亿参数的大脑,究竟是怎么被训练出来的?而作为现代 AI 地基的 Transformer 架构,又是如何理解人类语言的?

本文将用最通俗的工程师视角,带你拆解 AI 的诞生三部曲,并深入其核心的数学机制。#

一、 AI 模型的训练三部曲#

AI 模型的训练过程,简单来说就像是人类读书学习、模拟考试,最后由老师批改指正的进化史。以目前主流的大语言模型(LLM)为例,整个诞生过程主要分为以下三个核心阶段:

1. 预训练 (Pre-training) ——“通读群书”#

这是最消耗算力(通常占 90% 以上)的阶段。AI 会阅读海量的原始文本,如网页、图书、维基百科、代码等。

  • 学习方式: 自监督学习(Self-supervised Learning),本质上就是**“文字接龙”**。给它半句话,让它预测下一个字是什么。
  • 目标: 让模型掌握语言语法、世界常识以及基本的逻辑推理能力。此时的模型虽“满腹经纶”,但还不会好好听话答题。

2. 微调 (Fine-tuning) ——“做模拟题”#

为了让 AI 能够理解人类的指令(例如“帮我写封邮件”或“翻译这段话”),工程师会准备大量“问题 - 答案”对齐的高质量数据。

  • 学习方式: 监督微调(SFT, Supervised Fine-tuning)。AI 对着人类给的标准答案范本进行模仿。
  • 目标: 让 AI 学会以人类习惯的对话格式、语气来精准回答问题。

3. 对齐与强化学习 (Alignment) ——“导师点评”#

最后,为了让 AI 的回答更安全、更有用、不胡说八道,工程师会引入人类反馈强化学习(RLHF)

  • 学习方式: AI 对同一个问题给出多个回答,由人类评价员(或另一个 AI 裁判)给这些回答打分,告诉它哪种回答更好、哪种包含偏见或危险信息。
  • 目标: 调整模型的参数,使其行为符合人类的道德与实用标准。

💡 AI 训练的三大支柱:

  • 数据 (Data): 决定了 AI 的天花板。顶级模型需要吞噬数十万亿(Trillions)的 Token。
  • 算力 (Compute): 需要成千上万张高性能 GPU(如 NVIDIA H100 等)组成集群连续计算数周或数月。
  • 算法 (Algorithm): 也就是学习方法,目前几乎全数基于 Transformer 架构。

二、 什么是 Transformer 架构?#

Transformer 算法架构是 Google 在 2017 年提出的一种神经网络模型,它是如今所有生成式大模型背后共同的“地基”。

在 Transformer 出现之前,旧的 AI(如 RNN/LSTM 模型)读文章就像人类逐字看书,看到后面容易忘记前面,且无法同时处理多个字。而 Transformer 厉害的地方在于其两大超能力:

  • 自注意力机制 (Self-Attention): 懂得联想与抓重点。当读到一个词时,会同时看向句子里的其他所有词,并计算关联性。例如能完美分清“水果店里的苹果”与“最新款的苹果”在语义上的不同。
  • 并行计算 (Parallel Processing): 速度的革命。它抛弃了顺序限制,可以把整篇文章的所有文字同时输入进去一起计算,完美释放了 GPU 的并行算力。

三、 深入底层:自注意力机制的数学之美#

要理解自注意力机制(Self-Attention)在数学上是怎么算出来的,我们可以把 AI 想象成一个超高效的“图书馆资料检索系统”

在数学上,Transformer 把每个输入的文字,都转换成三种不同的身份向量:QQKKVV

  • QQ (Query - 查询词): “我想找什么?”——代表当前这个字,去问其他字有没有跟它相关的线索。
  • KK (Key - 键值): “我是谁,我有什么标签?”——代表其他字用来被匹配的特征。
  • VV (Value - 数值): “我包含的真实语义信息是什么?”——一旦匹配成功,实际要贡献出来的内容。

数学计算的四个步骤#

假设我们有一句歌词:“那只沙发上睡觉”,我们来看看 AI 是如何计算“”和“沙发”之间的关联度的:

1. 身份转化(矩阵相乘)#

文字进来后,会先被转换成一串数字(Embedding 向量 XX)。接着,AI 会用三个在训练中学聪明的矩阵 WQ,WK,WVW_Q, W_K, W_V,去跟 XX 相乘,把每个字都复制出三个分身:

Q=XWQ,K=XWK,V=XWVQ = X \cdot W_Q, \quad K = X \cdot W_K, \quad V = X \cdot W_V

2. 算关联度(点积 Dot Product)#

现在“”使出了它的查询词 QQ_{\text{猫}},去跟句子里所有字的 KK(包括它自己、沙发、睡觉等)进行点积(Dot Product)计算。在线性代数中,两个向量的点积越高,代表它们的方向越接近,也就是语义越相关

  • Q×K沙发=120Q_{\text{猫}} \times K_{\text{沙发}} = 120(得分很高,因为猫常躺沙发)
  • Q×K那只=15Q_{\text{猫}} \times K_{\text{那只}} = 15(得分很低,纯属语法搭配)

3. 防数值爆炸与归一化(Scale & Softmax)#

点积算分数可能很大,这在神经网络中会导致计算不稳定。所以数学上做了两件事:

  1. 除以 dk\sqrt{d_k}(缩放): dkd_k 是向量的维度。这就像把百分制的分数等比例缩小。
  2. Softmax 函数: 把这些分数转化成总和为 1 (100%) 的概率分布(权重)

经过这一步,分数变成了权重(例如:沙发 65%、睡觉 25%、那只 10%)。

4. 加权加总(产出新语义)#

最后,拿这些百分比(权重),去乘以每个字对应的 VV (真实信息),然后全部加起来:

新・猫的向量=(0.65×V沙发)+(0.25×V睡觉)+(0.10×V那只)\text{新・猫的向量} = (0.65 \times V_{\text{沙发}}) + (0.25 \times V_{\text{睡觉}}) + (0.10 \times V_{\text{那只}})


结语:著名的经典公式#

这四个步骤在 Transformer 论文中,被凝聚成了那个改变世界的经典数学公式:

Attention(Q,K,V)=Softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{Softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

  • QKTQK^T:让所有字两两计算关联度,得到一张大表格。
  • ÷dk\div \sqrt{d_k}:把数字缩小,防止计算崩溃。
  • Softmax\text{Softmax}:把分数变成比例(加起来等于 1)。
  • ×V\times V:根据比例,把大家的精华信息融合在一起。

经过这番数学计算,当 AI 读完这一层,它吐出的新向量就真正理解了“这是一只躺在沙发上昏睡的猫”,而不再只是孤立的字词。这就是现代 AI 能够理解人类复杂语言的数学秘密。