大模型原理
大模型原理 学习主线:AI 可以先理解成“寻找输入到输出映射函数”的过程;神经网络负责逼近复杂函数;Transformer 提升序列建模能力和训练效率;大语言模型则是在数据、参数、算力和工程生态共同放大后的结果。 这篇笔记按“概念主线 + 关键机制 + 落地理解”的方式整理。重点不是背术语,而是把大模型拆回几个基础组件:函数、参数、损失、梯度、向量、注意力、预测下一个 token。 一、核心思想:万物皆函数人工智能的底层问题,本质上可以先看成一个映射问题: 输入一些信息,经过某种规则或模型,输出一个更有用的结果。 例如: 输入房子的面积、地段、楼层,输出大概房价。 输入天气、气温、是否下雨,输出穿衣建议。 输入一句话的前文,输出下一个最可能出现的 token。 从技术路线看,AI 的发展可以粗略分成两种思路: 路线核心想法典型特点局限 符号主义人类显式写出规则函数规则清晰、可解释性强,例如勾股定理、牛顿第二定律面对图像识别、自然语言理解等复杂任务,很难手工写出完整规则 连接主义用数据训练模型,让模型近似真实规律不要求人类写死规则,而是通过参数调整学习隐式规律需要大量数据...



