在今天,像 ChatGPT、Claude 这样的生成式 AI 已经深入我们的生活与工作。你是否好奇过,这背后动辄千亿参数的大脑,究竟是怎么被训练出来的?而作为现代 AI 地基的 Transformer 架构,又是如何理解人类语言的?
本文将用最通俗的工程师视角,带你拆解 AI 的诞生三部曲,并深入其核心的数学机制。
一、 AI 模型的训练三部曲
AI 模型的训练过程,简单来说就像是人类读书学习、模拟考试,最后由老师批改指正的进化史。以目前主流的大语言模型(LLM)为例,整个诞生过程主要分为以下三个核心阶段:
1. 预训练 (Pre-training) ——“通读群书”
这是最消耗算力(通常占 90% 以上)的阶段。AI 会阅读海量的原始文本,如网页、图书、维基百科、代码等。
- 学习方式: 自监督学习(Self-supervised Learning),本质上就是**“文字接龙”**。给它半句话,让它预测下一个字是什么。
- 目标: 让模型掌握语言语法、世界常识以及基本的逻辑推理能力。此时的模型虽“满腹经纶”,但还不会好好听话答题。
2. 微调 (Fine-tuning) ——“做模拟题”
为了让 AI 能够理解人类的指令(例如“帮我写封邮件”或“翻译这段话”),工程师会准备大量“问题 - 答案”对齐的高质量数据。
- 学习方式: 监督微调(SFT, Supervised Fine-tuning)。AI 对着人类给的标准答案范本进行模仿。
- 目标: 让 AI 学会以人类习惯的对话格式、语气来精准回答问题。
3. 对齐与强化学习 (Alignment) ——“导师点评”
最后,为了让 AI 的回答更安全、更有用、不胡说八道,工程师会引入人类反馈强化学习(RLHF)。
- 学习方式: AI 对同一个问题给出多个回答,由人类评价员(或另一个 AI 裁判)给这些回答打分,告诉它哪种回答更好、哪种包含偏见或危险信息。
- 目标: 调整模型的参数,使其行为符合人类的道德与实用标准。
💡 AI 训练的三大支柱:
- 数据 (Data): 决定了 AI 的天花板。顶级模型需要吞噬数十万亿(Trillions)的 Token。
- 算力 (Compute): 需要成千上万张高性能 GPU(如 NVIDIA H100 等)组成集群连续计算数周或数月。
- 算法 (Algorithm): 也就是学习方法,目前几乎全数基于 Transformer 架构。
二、 什么是 Transformer 架构?
Transformer 算法架构是 Google 在 2017 年提出的一种神经网络模型,它是如今所有生成式大模型背后共同的“地基”。
在 Transformer 出现之前,旧的 AI(如 RNN/LSTM 模型)读文章就像人类逐字看书,看到后面容易忘记前面,且无法同时处理多个字。而 Transformer 厉害的地方在于其两大超能力:
- 自注意力机制 (Self-Attention): 懂得联想与抓重点。当读到一个词时,会同时看向句子里的其他所有词,并计算关联性。例如能完美分清“水果店里的苹果”与“最新款的苹果”在语义上的不同。
- 并行计算 (Parallel Processing): 速度的革命。它抛弃了顺序限制,可以把整篇文章的所有文字同时输入进去一起计算,完美释放了 GPU 的并行算力。
三、 深入底层:自注意力机制的数学之美
要理解自注意力机制(Self-Attention)在数学上是怎么算出来的,我们可以把 AI 想象成一个超高效的“图书馆资料检索系统”。
在数学上,Transformer 把每个输入的文字,都转换成三种不同的身份向量:、、。
- (Query - 查询词): “我想找什么?”——代表当前这个字,去问其他字有没有跟它相关的线索。
- (Key - 键值): “我是谁,我有什么标签?”——代表其他字用来被匹配的特征。
- (Value - 数值): “我包含的真实语义信息是什么?”——一旦匹配成功,实际要贡献出来的内容。
数学计算的四个步骤
假设我们有一句歌词:“那只猫在沙发上睡觉”,我们来看看 AI 是如何计算“猫”和“沙发”之间的关联度的:
1. 身份转化(矩阵相乘)
文字进来后,会先被转换成一串数字(Embedding 向量 )。接着,AI 会用三个在训练中学聪明的矩阵 ,去跟 相乘,把每个字都复制出三个分身:
2. 算关联度(点积 Dot Product)
现在“猫”使出了它的查询词 ,去跟句子里所有字的 (包括它自己、沙发、睡觉等)进行点积(Dot Product)计算。在线性代数中,两个向量的点积越高,代表它们的方向越接近,也就是语义越相关。
- (得分很高,因为猫常躺沙发)
- (得分很低,纯属语法搭配)
3. 防数值爆炸与归一化(Scale & Softmax)
点积算分数可能很大,这在神经网络中会导致计算不稳定。所以数学上做了两件事:
- 除以 (缩放): 是向量的维度。这就像把百分制的分数等比例缩小。
- Softmax 函数: 把这些分数转化成总和为 1 (100%) 的概率分布(权重)。
经过这一步,分数变成了权重(例如:沙发 65%、睡觉 25%、那只 10%)。
4. 加权加总(产出新语义)
最后,拿这些百分比(权重),去乘以每个字对应的 (真实信息),然后全部加起来:
结语:著名的经典公式
这四个步骤在 Transformer 论文中,被凝聚成了那个改变世界的经典数学公式:
- :让所有字两两计算关联度,得到一张大表格。
- :把数字缩小,防止计算崩溃。
- :把分数变成比例(加起来等于 1)。
- :根据比例,把大家的精华信息融合在一起。
经过这番数学计算,当 AI 读完这一层,它吐出的新向量就真正理解了“这是一只躺在沙发上昏睡的猫”,而不再只是孤立的字词。这就是现代 AI 能够理解人类复杂语言的数学秘密。