大模型通识
大模型通识
这篇文章重点不是讲公式,也不是罗列厂商名字,而是先帮零基础读者建立一张 AI 概念地图。只要能分清模型、上下文、知识库、工具调用、工作流和智能体分别解决什么问题,后面再学工具和项目就不会乱。
很多人刚接触 AI 时,会同时看到 ChatGPT、Claude、DeepSeek、豆包、RAG、Agent、MCP、工作流这些词。词越多,越容易误以为自己在学习 AI,其实只是在收集名词。
更稳的方式是先抓主线:大模型负责理解和生成,Prompt 负责给任务,上下文负责给材料,RAG 负责补知识,Tools 负责做动作,Workflow 和 Agent 负责把这些能力串成流程。
一、先用一张图理解 AI 应用
一个常见 AI 应用,可以先这样理解:
12345678用户目标 -> Prompt 说明任务 -> 上下文提供材料 -> xgood 进行理解、推理和生成 -> RAG 补充外部知识 -> Tools 调用外部工具 -> Workflow / Agent 串起流程 -> 输出结果并让人验收
这张图里最重要的不是名词,而是分工:
- xgood 解决“理解和生成”的问题。
- Prompt 解决“怎么把任务说清楚”的问题。
- 上下文 解决“模型现在能看到什么材料”的问题。
- RAG 解决“模型不知道或记不准时,先查资料”的问题。
- Tools 解决“模型不只回答,还能搜索、读文件、调接口、写表格”的问题。
- Workflow 解决“固定流程如何稳定执行”的问题。
- Agent 解决“目标明确但路径不固定时,如何动态推进”的问题。
- MCP 解决“模型和外部工具之间如何更标准地连接”的问题。
如果你能先把这层关系讲清楚,就已经比只会说“接入大模型”更接近真正理解 AI 产品了。
二、大模型到底是什么
大模型可以先用一句话理解:
大模型是一类从大量数据中学习规律,并根据输入生成结果的模型。
放到日常使用里,它最常见的能力是:
- 回答问题
- 总结材料
- 改写文案
- 翻译内容
- 分析表格
- 辅助写代码
- 根据图片、音频、视频做理解和生成
所以大模型不是魔法,也不是数据库。它更像一个“非常擅长根据上下文继续完成任务的生成系统”。
2.1 从函数到神经网络
如果从最简单的角度看,很多 AI 问题都像是在找一个函数:
1输入 x -> 规则或模型 f(x) -> 输出 y
比如:
- 输入一句话,输出下一句最可能是什么。
- 输入一张图片,输出图片里有什么。
- 输入用户需求,输出一份产品方案。
传统规则适合边界清楚的问题,但真实世界往往太复杂。于是模型从简单规则、线性方法、非线性拟合,一步步走向神经网络。
神经网络可以先理解成很多层“小函数”的组合。输入层接收信息,隐藏层提炼特征,输出层给出结果。层数更多、数据更多、参数更多之后,它能处理的问题也更复杂。
2.2 xgood 为什么突然重要
xgood 是 Large Language Model,也就是大语言模型。它最朴素的能力是:
根据前面的内容,预测后面最可能出现什么。
这个说法听起来简单,但当数据规模、参数规模和训练成本都变大后,模型就表现出问答、总结、推理、代码、写作、翻译等能力。
你可以把它理解成:它不是只会查答案,而是能基于上下文生成一个看起来合理的结果。
这也解释了为什么它既强又不稳定:它擅长生成,但生成并不天然等于真实。
三、Token、上下文和幻觉
这三个概念是小白最应该先搞懂的,因为它们直接决定你怎么用 AI。
3.1 Token 是模型处理内容的单位
模型不是按“人类自然段”理解文本,而是把文字切成更小的单位来处理,这些单位通常叫 Token。
你不用精确计算每句话有多少 Token,只需要知道三点:
- 输入内容越长,消耗 Token 越多。
- 输出内容越长,也会消耗 Token。
- 模型一次能处理的 Token 有上限,这个上限就影响上下文长度。
所以让 AI 处理超长材料时,不能只说“你帮我看完全部内容”。更好的做法是先分段、提炼,再逐步汇总。
3.2 上下文是模型当前能看到的材料
上下文不是“模型永远记得的一切”,而是这一次对话或这一次任务里模型能看到的内容。
上下文通常包括:
- 你刚刚写的指令
- 你上传或粘贴的材料
- 之前几轮对话
- 系统给模型的规则
- 工具返回的结果
很多 AI 出错,不是因为模型完全不行,而是因为上下文不完整。比如你让它“按之前那个格式输出”,但它已经看不到之前的格式,结果自然会乱。
3.3 幻觉是生成式 AI 的常见风险
幻觉不是模型“故意骗人”,而是模型在信息不足、指令模糊或事实不可验证时,仍然生成了一个看起来像真的答案。
常见表现包括:
- 编造不存在的论文、链接、产品版本
- 把相似概念混在一起
- 对没有证据的事情给出肯定结论
- 在代码或配置里写出不存在的参数
降低幻觉的关键不是反复要求“你要认真”,而是改变任务设计:
- 给足材料
- 要求列出来源
- 把不确定内容标成待核验
- 对高风险动作加入人工确认
- 用测试、日志、样例输出做验收
四、Prompt:不是咒语,而是任务说明
Prompt 就是你给模型的任务说明。它不是玄学咒语,而是把任务、材料、边界和输出标准讲清楚。
一个更稳定的 Prompt,通常包含 5 件事:
- 角色:你希望模型站在什么视角处理问题。
- 任务:到底要完成什么。
- 材料:可以依据哪些输入。
- 约束:哪些事情不能做,哪些风险要注意。
- 输出:用什么结构、格式和粒度交付。
比如,不要只写:
1帮我分析这个产品。
可以改成:
1你是 AI 产品经理。请基于我提供的产品介绍,按用户目标、核心场景、输入材料、输出结果、验收标准和潜在风险六个维度分析。不要补充没有证据的事实,不确定内容标为待核验。
这个差别很大。前者是在聊天,后者是在派任务。
五、Embedding 和 RAG:让模型先查资料
很多人把 RAG 理解成“知识库问答”,这个理解没错,但还不够完整。
5.1 Embedding 是把内容变成可比较的向量
Embedding 可以先理解成:
把文字、图片或其他内容转换成一串数字,让计算机能比较它们的语义相似度。
比如用户问“怎么配置环境变量”,系统可以通过向量检索找到“环境变量设置步骤”“API Key 配置说明”“Windows 终端配置”这些相关内容。
Embedding 不是给人看的,它是给系统检索用的。
5.2 RAG 是先检索,再生成
RAG 的完整意思是 Retrieval-Augmented Generation,可以简单理解成:
1用户提问 -> 检索相关资料 -> 把资料放进上下文 -> 模型基于资料生成答案
它适合这些场景:
- 公司制度问答
- 产品文档问答
- 个人知识库检索
- 客服知识库
- 需要引用来源的资料整理
RAG 解决的不是“让模型变聪明”,而是让模型回答时有材料可依。
5.3 RAG 也不是万能的
RAG 常见问题有三类:
- 检索不到:资料没入库、切分方式不对、问题表达太模糊。
- 检索错:找到了相似但不相关的内容。
- 生成错:资料是对的,但模型理解或总结错了。
所以做 RAG 产品时,不只要看模型回答,还要看检索结果、来源引用和失败提示。
六、Tools、Memory 和 MCP:让模型能做事
只会聊天的模型,最多是一个问答入口。真正的 AI 应用通常还要连接工具、记录状态、调用外部系统。
6.1 Tools 是模型可以调用的外部能力
工具可以是:
- 搜索网页
- 读取文件
- 写入表格
- 运行代码
- 调用接口
- 创建待办
- 发送通知
工具调用让 AI 从“回答问题”走向“完成任务”。但工具越多,权限风险越高,所以必须设计边界。
比如涉及登录、支付、删除、外部发送、权限变更时,不能让模型自动完成,必须加人工确认。
6.2 Memory 是系统保留的状态和偏好
Memory 可以理解成模型或系统记住的信息。它可能包括:
- 用户偏好
- 历史任务
- 项目背景
- 已完成步骤
- 待办状态
但记忆不是越多越好。真正有用的记忆应该服务任务,比如“这个项目统一用中文写文档”“输出表格要包含负责人和截止日期”。
不该记的内容也要避免记,比如敏感数据、临时信息、错误结论。
6.3 MCP 是连接工具的一种标准接口
MCP 可以先用一个比喻理解:
它像 AI 工具世界里的通用插口,让模型更标准地连接文件、数据库、浏览器、代码仓库和各种外部服务。
它解决的是“连接方式标准化”的问题。没有标准时,每个工具都要单独适配;有了标准,模型和工具之间的协作会更统一。
但 MCP 不会自动消除幻觉,也不会自动保证任务成功。它只是让连接工具更规范,真正可靠还要靠权限设计、流程设计和验收设计。
七、Workflow 和 Agent:固定流程与动态推进
这两个词经常被混用,但产品设计时一定要分清。
7.1 Workflow 是固定流程
Workflow 更像流水线。步骤提前设计好,每次大致按同样顺序执行。
比如一个资料整理工作流:
1上传资料 -> 提取标题 -> 总结重点 -> 输出表格 -> 生成结论
它的优点是稳定、好控、容易排错。适合规则明确、流程重复、结果格式稳定的任务。
7.2 Agent 是围绕目标动态推进
Agent 更像一个能根据情况调整步骤的任务执行系统。
比如你让它做竞品调研,它可能会:
- 先确认竞品范围。
- 搜索公开资料。
- 打开网页提取信息。
- 发现资料不足后换关键词。
- 整理对比表。
- 标记待核验内容。
- 输出简报。
Agent 的关键不是“会聊天”,而是能围绕目标拆任务、调工具、保存状态、处理异常,并在关键动作前请求确认。
7.3 判断该用 Workflow 还是 Agent
可以用一个简单判断:
- 步骤固定、输入稳定、结果格式明确:优先 Workflow。
- 路径不固定、需要补资料、要处理异常:更接近 Agent。
初学者不要一上来就追求 Agent。很多真实业务场景,用清楚的 Workflow 反而更可靠。
八、普通人应该按什么顺序学
如果你是零基础,建议按这个顺序:
- 先理解大模型是什么,不急着追最新工具。
- 学会写清楚 Prompt,把任务、材料、边界和输出标准说清。
- 理解 Token 和上下文,知道为什么长材料要分段处理。
- 理解幻觉,养成来源、核验、人工确认的习惯。
- 学 RAG,知道知识库问答为什么要先检索再生成。
- 学 Workflow,把重复任务做成稳定流程。
- 最后学 Agent,让模型在有边界的情况下动态完成任务。
这个顺序能避免一种很常见的问题:名词都会说,但遇到真实任务不知道该用哪一层能力。
九、学完这篇你应该能做什么
读完这篇,不要求你马上开发一个完整 AI 系统,但至少应该能完成 4 件事:
- 看到一个 AI 产品时,能说出它主要用了哪些能力。
- 写 Prompt 时,能主动补充任务、材料、边界和输出标准。
- 做知识库问答时,能理解为什么要检索、引用来源和标记不确定内容。
- 看到 Agent 宣传时,能判断它是真能拆任务和调工具,还是只是套了一个聊天入口。
最后记住一句话:
AI 学习的第一步不是追工具,而是知道每个概念到底解决哪一层问题。
十、参考来源与延伸阅读
- OpenAI 官方文档:用于理解大模型、工具调用和应用开发基础。
- Anthropic MCP 相关资料:用于理解模型连接外部工具的标准化思路。
- 本地素材库:
01 人工智能产品学习知识库/索引资料,用于追溯视频素材和主题提炼。




