大模型原理
大模型原理
学习主线:AI 可以先理解成“寻找输入到输出映射函数”的过程;神经网络负责逼近复杂函数;Transformer 提升序列建模能力和训练效率;大语言模型则是在数据、参数、算力和工程生态共同放大后的结果。
这篇笔记按“概念主线 + 关键机制 + 落地理解”的方式整理。重点不是背术语,而是把大模型拆回几个基础组件:函数、参数、损失、梯度、向量、注意力、预测下一个 token。
一、核心思想:万物皆函数
人工智能的底层问题,本质上可以先看成一个映射问题:
输入一些信息,经过某种规则或模型,输出一个更有用的结果。
例如:
- 输入房子的面积、地段、楼层,输出大概房价。
- 输入天气、气温、是否下雨,输出穿衣建议。
- 输入一句话的前文,输出下一个最可能出现的 token。
从技术路线看,AI 的发展可以粗略分成两种思路:
路线
核心想法
典型特点
局限
符号主义
人类显式写出规则函数
规则清晰、可解释性强,例如勾股定理、牛顿第二定律
面对图像识别、自然语言理解等复杂任务,很难手工写出完整规则
连接主义
用数据训练模型,让模型近似真实规律
不要求人类写死规则,而是通过参数调整学习隐式规律
需要大量数据和算力,也会带来幻觉、泛化、安全等问题
笔记结论:
- 符号主义强调“显式规则”。
- 连接主义强调“数据驱动的近似函数”。
- 现代神经网络和大模型,主要沿着连接主义路线发展。
二、从函数到神经网络
2.1 线性函数:最基础的模型形式
最简单的模型可以写成:
1y = wx + b
其中:
x是输入。y是输出。w是权重,表示输入的重要程度。b是偏置,用来调整整体输出位置。
线性函数结构简单、容易理解,但它只能表达“直来直去”的关系。现实世界里的问题通常不是单一变量、单一直线能解释的。
2.2 激活函数:让模型具备非线性表达能力
神经网络会在线性变换之后加入激活函数,例如 ReLU、sigmoid、tanh。
激活函数的作用:
- 打破纯线性叠加的限制。
- 让模型可以拟合曲线、边界、组合模式等复杂关系。
- 让多层网络具备逼近复杂函数的能力。
如果没有激活函数,多层线性变换叠在一起,本质上仍然只是一个线性函数;有了非线性激活,多层网络才真正有表达复杂规律的能力。
2.3 神经网络:很多小函数叠在一起
神经网络可以理解成大量函数计算单元的层级组合:
- 输入层:接收原始数据。
- 隐藏层:逐层提取更抽象的特征。
- 输出层:给出预测结果。
一个神经元通常做两件事:
- 把多个输入按不同权重混合起来。
- 经过激活函数,把结果传给下一层。
多层网络的价值在于逐级抽象。以图像识别为例,前几层可能识别边缘和颜色,中间层识别局部轮廓,后面层再组合出“耳朵、眼睛、形状”等更高级特征,最后输出分类结果。
2.4 前向传播:从输入算到输出
前向传播就是模型从输入层一路算到输出层的过程。
笔记理解:
- 输入进入模型。
- 每一层都做一次“线性变换 + 激活函数”。
- 信号逐层向前传递。
- 最终得到预测值。
它没有神秘含义,本质就是复合函数的一次计算。
三、模型训练:让函数一点点变准
神经网络一开始并不会做任务。训练的目标,是把参数调到更合适的位置,让预测结果越来越接近真实答案。
3.1 损失函数:衡量模型错得有多远
损失函数用于衡量预测值和真实值之间的差距。
常见例子是均方误差(MSE):
- 先计算预测值与真实值的误差。
- 再平方,避免正负误差互相抵消。
- 对所有样本求平均,得到整体误差。
损失越小,说明模型当前参数越适合这批数据。
3.2 梯度下降:沿着更优方向调参数
简单线性模型有时可以直接求解析解,但神经网络是复杂的非线性复合函数,很难一步算出最优参数。因此训练通常使用迭代优化:
- 根据当前参数做一次预测。
- 用损失函数计算误差。
- 计算参数应该往哪个方向调整。
- 按学习率控制步幅,更新参数。
- 重复多轮,直到损失足够小或训练达到停止条件。
学习率很关键:
- 学习率太大,容易越过最优点,训练震荡。
- 学习率太小,收敛速度会很慢。
3.3 反向传播:高效计算每层参数的责任
神经网络有很多层,每层都有参数。反向传播的作用,是从输出层开始,根据链式法则逐层计算每个参数对最终损失的影响。
完整训练流程可以记成:
12345前向传播得到预测结果→ 损失函数计算误差→ 反向传播计算梯度→ 优化器更新参数→ 多轮循环直到模型变准
笔记结论:
- 前向传播负责“算结果”。
- 损失函数负责“量化错误”。
- 反向传播负责“分配责任”。
- 梯度下降负责“更新参数”。
四、训练挑战与常见解决方案
神经网络训练并不是只要堆数据和堆参数就能稳定变好。实际训练中会遇到一些典型问题。
问题
表现
常见解决方案
过拟合
训练集表现很好,新数据表现很差
增加数据、数据增强、简化模型、提前停止、正则化、Dropout
梯度消失
网络越深,前面层几乎学不动
合理初始化、残差连接、归一化、选择更合适的激活函数
梯度爆炸
参数更新过大,训练不稳定
梯度裁剪、降低学习率、归一化
收敛慢
损失下降缓慢,训练效率低
动量法、RMSprop、Adam 等优化器
计算开销大
全量数据训练成本过高
Mini-batch 小批次训练、分布式训练、混合精度训练
这些方法的共同目标,是让模型在可承受的计算成本内,稳定地学到可泛化的规律。
五、文本表示:Token 与词嵌入
大语言模型处理的是文本,但模型不能直接计算自然语言本身。文本需要先转换成可计算的数字形式。
5.1 Token:模型处理文本的基本单位
Token 是模型处理文本时的最小单位之一。它不一定等于一个汉字,也不一定等于一个完整单词。
例如:
- 一个英文单词可能被拆成多个子词 token。
- 一个标点符号可能单独成为 token。
- 中文可能按字、词片段或混合方式切分。
上下文长度指的是模型一次能处理的 token 总量。上下文越长,模型能保留的历史信息越多,但计算成本也越高。
5.2 向量:让文字变成可计算对象
模型会把 token 映射成向量,也就是一组数字。
向量的意义:
- 让模型可以计算词与词之间的关系。
- 让语义相近的内容在向量空间里更接近。
- 让后续神经网络可以继续做矩阵运算。
词嵌入(Embedding)就是把离散 token 转成连续向量的过程。训练好的向量空间往往能表达语义关系,例如“桌子”和“椅子”的距离,通常会比“桌子”和“天气”更接近。
六、从 CNN、RNN 到 Transformer
Transformer 不是凭空出现的。它是在 CNN、RNN 等经典架构之后,为了解决序列建模效率和长距离依赖问题而成为主流的。
6.1 CNN:更适合图像等空间数据
卷积神经网络(CNN)的核心思想,是用卷积核在图像上滑动,提取局部特征。
相比全连接层,CNN 的优势是:
- 参数共享,参数量更少。
- 保留局部空间关系。
- 对图像平移、局部纹理等特征更友好。
典型结构:
1卷积层 → 池化层 → 多轮堆叠 → 全连接层 → 输出结果
CNN 至今仍然是计算机视觉任务的重要基础。
6.2 RNN:面向文本和语音等序列数据
循环神经网络(RNN)的核心思想,是引入隐藏状态,让信息按时间步逐个传递。
它适合处理有顺序的数据,例如:
- 文本。
- 语音。
- 时间序列。
RNN 的局限也很明显:
- 长句子开头的信息传到后面容易衰减,形成长期依赖问题。
- 必须按顺序逐步计算,难以并行,训练效率低。
LSTM 和 GRU 通过门控结构缓解了长期依赖问题,但没有彻底解决串行计算的效率瓶颈。
6.3 Transformer 的位置
Transformer 的关键突破,是不再依赖 RNN 那种一个词一个词传递信息的方式,而是让序列中的 token 直接计算彼此关系。
它解决了两类核心问题:
- 更直接地捕捉远距离上下文关系。
- 更适合大规模并行训练。
这也是它成为大语言模型核心架构的主要原因。
七、Transformer:用注意力建立上下文关系
Transformer 的核心机制是自注意力(Self-Attention)。它让每个 token 都能根据上下文,重新计算自己的表示。
7.1 自注意力机制:Q、K、V
每个 token 进入模型后,会通过线性变换生成三类向量:
- Q(Query,查询):当前 token 想要寻找什么信息。
- K(Key,键):当前 token 可以被别人匹配的特征。
- V(Value,值):当前 token 真正提供的信息内容。
计算过程可以简化成三步:
- 用某个 token 的 Q 去和所有 token 的 K 计算相关性。
- 把相关性转成权重。
- 用这些权重对所有 token 的 V 加权求和,得到融合上下文的新表示。
笔记理解:
自注意力不是按顺序传话,而是让每个 token 直接查看全局上下文,再按相关程度提取信息。
7.2 多头注意力:从多个角度看关系
单个注意力头只能从一个表示空间里看关系。多头注意力会并行使用多个注意力头,让模型从不同角度捕捉语义关系。
例如,同一句话里可能同时存在:
- 主语和谓语的关系。
- 指代关系。
- 修饰关系。
- 上下文主题关系。
多头注意力会把这些不同维度的信息分别捕捉,再拼接融合。
7.3 位置编码:补上顺序信息
自注意力本身擅长看全局关系,但它天然不知道 token 的先后顺序。因此 Transformer 需要引入位置编码,让模型知道每个 token 在序列中的位置。
没有位置编码时,“我喜欢你”和“你喜欢我”可能只是一组相同 token 的集合;有了位置信息,模型才能区分顺序带来的语义差异。
7.4 编码器与解码器
经典 Transformer 由编码器和解码器组成:
- 编码器(Encoder):读取输入序列,生成语义表示。BERT 这类模型主要使用编码器结构,适合理解类任务。
- 解码器(Decoder):根据已有内容逐步生成下一个 token。GPT 这类模型主要使用解码器结构,适合生成类任务。
解码器里会使用掩码注意力,避免模型在训练时提前看到未来 token,保证它学习的是“根据前文预测后文”。
八、xgood 如何生成文字
大语言模型的核心训练任务可以概括为一句话:
根据前面的上下文,预测下一个最可能出现的 token。
这个任务看起来朴素,但当训练数据、模型参数和算力规模足够大时,模型会从海量语言模式中学到非常复杂的统计规律。
8.1 生成过程
大模型生成文本时通常是逐步完成的:
- 把输入文本切成 token。
- 将 token 转成向量。
- 通过 Transformer 计算上下文表示。
- 输出下一个 token 的概率分布。
- 根据采样策略选出一个 token。
- 把新 token 接到上下文后面,继续预测下一个。
最终我们看到的回答,就是一串 token 连续生成后的结果。
8.2 预训练、微调与对齐
大模型能力通常来自几个阶段:
- 预训练:在大规模通用语料上学习语言规律和世界知识。
- 微调:针对特定任务或领域做适配,让模型更符合业务场景。
- 对齐训练:让模型更符合人类指令偏好、安全要求和输出规范。
预训练决定基础能力,微调决定场景适配,对齐训练决定交互体验和安全边界。
8.3 涌现能力
当模型规模、数据规模和训练质量达到一定水平后,模型可能表现出小模型不明显具备的能力,例如:
- 多轮对话。
- 复杂总结。
- 推理链组织。
- 工具调用。
- 代码生成与修改。
这类能力通常被称为涌现能力。它并不意味着模型拥有神秘机制,而是复杂函数在规模扩大后表现出的新能力边界。
8.4 幻觉问题
大模型并不是事实数据库。它是在根据上下文预测合理输出,因此可能生成语法流畅但事实错误的内容。
常见缓解方式:
- 引入检索增强生成(RAG)。
- 给出更明确的上下文。
- 对关键事实做外部校验。
- 在业务系统中加入引用来源、日志记录和人工审核。
九、大模型时代的关键概念与生态
大模型不仅是一个模型文件,也是一整套技术生态。
方向
关键内容
落地理解
模型类型
闭源模型、开源或开放权重模型
闭源模型通常通过 API 使用;开放权重模型可私有化部署和深度定制
部署方式
云服务、API、本地私有化部署
取决于成本、数据安全、延迟、可控性要求
能力增强
RAG、联网、多模态、工具调用
用外部知识和工具补足模型自身限制
工程优化
量化、蒸馏、剪枝、LoRA
降低训练、推理和微调成本
应用形态
AIGC、Agent、工作流自动化
从单次问答走向可执行任务和业务流程
生态标准
MCP、A2A 等协议探索
让模型、工具、智能体之间更容易协作
当前大模型落地的重点,已经不只是拼参数规模,也包括:
- 数据质量。
- 推理成本。
- 上下文管理。
- 工具调用能力。
- 知识库建设。
- 安全合规。
- 业务流程集成。
真正产生业务价值的,通常不是“模型很强”这件事本身,而是模型能否被稳定嵌入真实场景。
十、学习主线总结
这条主线可以作为后续学习大模型的骨架:
- 函数:AI 问题可以先看成输入到输出的映射。
- 参数:模型通过参数表达可调整的规则。
- 神经网络:多层函数组合,让模型能逼近复杂规律。
- 训练:通过损失函数、反向传播和梯度下降不断调参数。
- 文本表示:自然语言先被切成 token,再变成向量。
- Transformer:用自注意力直接建模上下文关系,并支持并行训练。
- xgood:在大规模数据、参数、算力和工程体系下,执行大规模下一个 token 预测。
- 应用生态:通过 RAG、Agent、多模态、工具调用和私有化部署,把模型能力接入真实业务。
最终可以把大模型理解成一句话:
大模型不是魔法,而是神经网络沿着“近似复杂函数”的路线,在数据、算力、架构和工程生态共同推动下形成的新阶段。
顺着这条线继续学 Transformer 细节、预训练、微调、RAG、Agent 和模型部署,概念之间会更容易连起来。




