大模型通识

这篇文章重点不是讲公式,也不是罗列厂商名字,而是先帮零基础读者建立一张 AI 概念地图。只要能分清模型、上下文、知识库、工具调用、工作流和智能体分别解决什么问题,后面再学工具和项目就不会乱。

很多人刚接触 AI 时,会同时看到 ChatGPT、Claude、DeepSeek、豆包、RAG、Agent、MCP、工作流这些词。词越多,越容易误以为自己在学习 AI,其实只是在收集名词。

更稳的方式是先抓主线:大模型负责理解和生成,Prompt 负责给任务,上下文负责给材料,RAG 负责补知识,Tools 负责做动作,Workflow 和 Agent 负责把这些能力串成流程。

一、先用一张图理解 AI 应用

一个常见 AI 应用,可以先这样理解:

12345678用户目标 -> Prompt 说明任务 -> 上下文提供材料 -> xgood 进行理解、推理和生成 -> RAG 补充外部知识 -> Tools 调用外部工具 -> Workflow / Agent 串起流程 -> 输出结果并让人验收
这张图里最重要的不是名词,而是分工:

  • xgood 解决“理解和生成”的问题。
  • Prompt 解决“怎么把任务说清楚”的问题。
  • 上下文 解决“模型现在能看到什么材料”的问题。
  • RAG 解决“模型不知道或记不准时,先查资料”的问题。
  • Tools 解决“模型不只回答,还能搜索、读文件、调接口、写表格”的问题。
  • Workflow 解决“固定流程如何稳定执行”的问题。
  • Agent 解决“目标明确但路径不固定时,如何动态推进”的问题。
  • MCP 解决“模型和外部工具之间如何更标准地连接”的问题。

如果你能先把这层关系讲清楚,就已经比只会说“接入大模型”更接近真正理解 AI 产品了。

二、大模型到底是什么

大模型可以先用一句话理解:

大模型是一类从大量数据中学习规律,并根据输入生成结果的模型。

放到日常使用里,它最常见的能力是:

  • 回答问题
  • 总结材料
  • 改写文案
  • 翻译内容
  • 分析表格
  • 辅助写代码
  • 根据图片、音频、视频做理解和生成

所以大模型不是魔法,也不是数据库。它更像一个“非常擅长根据上下文继续完成任务的生成系统”。

2.1 从函数到神经网络

如果从最简单的角度看,很多 AI 问题都像是在找一个函数:

1输入 x -> 规则或模型 f(x) -> 输出 y
比如:

  • 输入一句话,输出下一句最可能是什么。
  • 输入一张图片,输出图片里有什么。
  • 输入用户需求,输出一份产品方案。

传统规则适合边界清楚的问题,但真实世界往往太复杂。于是模型从简单规则、线性方法、非线性拟合,一步步走向神经网络。

神经网络可以先理解成很多层“小函数”的组合。输入层接收信息,隐藏层提炼特征,输出层给出结果。层数更多、数据更多、参数更多之后,它能处理的问题也更复杂。

2.2 xgood 为什么突然重要

xgood 是 Large Language Model,也就是大语言模型。它最朴素的能力是:

根据前面的内容,预测后面最可能出现什么。

这个说法听起来简单,但当数据规模、参数规模和训练成本都变大后,模型就表现出问答、总结、推理、代码、写作、翻译等能力。

你可以把它理解成:它不是只会查答案,而是能基于上下文生成一个看起来合理的结果。

这也解释了为什么它既强又不稳定:它擅长生成,但生成并不天然等于真实。

三、Token、上下文和幻觉

这三个概念是小白最应该先搞懂的,因为它们直接决定你怎么用 AI。

3.1 Token 是模型处理内容的单位

模型不是按“人类自然段”理解文本,而是把文字切成更小的单位来处理,这些单位通常叫 Token。

你不用精确计算每句话有多少 Token,只需要知道三点:

  • 输入内容越长,消耗 Token 越多。
  • 输出内容越长,也会消耗 Token。
  • 模型一次能处理的 Token 有上限,这个上限就影响上下文长度。

所以让 AI 处理超长材料时,不能只说“你帮我看完全部内容”。更好的做法是先分段、提炼,再逐步汇总。

3.2 上下文是模型当前能看到的材料

上下文不是“模型永远记得的一切”,而是这一次对话或这一次任务里模型能看到的内容。

上下文通常包括:

  • 你刚刚写的指令
  • 你上传或粘贴的材料
  • 之前几轮对话
  • 系统给模型的规则
  • 工具返回的结果

很多 AI 出错,不是因为模型完全不行,而是因为上下文不完整。比如你让它“按之前那个格式输出”,但它已经看不到之前的格式,结果自然会乱。

3.3 幻觉是生成式 AI 的常见风险

幻觉不是模型“故意骗人”,而是模型在信息不足、指令模糊或事实不可验证时,仍然生成了一个看起来像真的答案。

常见表现包括:

  • 编造不存在的论文、链接、产品版本
  • 把相似概念混在一起
  • 对没有证据的事情给出肯定结论
  • 在代码或配置里写出不存在的参数

降低幻觉的关键不是反复要求“你要认真”,而是改变任务设计:

  • 给足材料
  • 要求列出来源
  • 把不确定内容标成待核验
  • 对高风险动作加入人工确认
  • 用测试、日志、样例输出做验收

四、Prompt:不是咒语,而是任务说明

Prompt 就是你给模型的任务说明。它不是玄学咒语,而是把任务、材料、边界和输出标准讲清楚。

一个更稳定的 Prompt,通常包含 5 件事:

  • 角色:你希望模型站在什么视角处理问题。
  • 任务:到底要完成什么。
  • 材料:可以依据哪些输入。
  • 约束:哪些事情不能做,哪些风险要注意。
  • 输出:用什么结构、格式和粒度交付。

比如,不要只写:

1帮我分析这个产品。
可以改成:

1你是 AI 产品经理。请基于我提供的产品介绍,按用户目标、核心场景、输入材料、输出结果、验收标准和潜在风险六个维度分析。不要补充没有证据的事实,不确定内容标为待核验。
这个差别很大。前者是在聊天,后者是在派任务。

五、Embedding 和 RAG:让模型先查资料

很多人把 RAG 理解成“知识库问答”,这个理解没错,但还不够完整。

5.1 Embedding 是把内容变成可比较的向量

Embedding 可以先理解成:

把文字、图片或其他内容转换成一串数字,让计算机能比较它们的语义相似度。

比如用户问“怎么配置环境变量”,系统可以通过向量检索找到“环境变量设置步骤”“API Key 配置说明”“Windows 终端配置”这些相关内容。

Embedding 不是给人看的,它是给系统检索用的。

5.2 RAG 是先检索,再生成

RAG 的完整意思是 Retrieval-Augmented Generation,可以简单理解成:

1用户提问 -> 检索相关资料 -> 把资料放进上下文 -> 模型基于资料生成答案
它适合这些场景:

  • 公司制度问答
  • 产品文档问答
  • 个人知识库检索
  • 客服知识库
  • 需要引用来源的资料整理

RAG 解决的不是“让模型变聪明”,而是让模型回答时有材料可依。

5.3 RAG 也不是万能的

RAG 常见问题有三类:

  • 检索不到:资料没入库、切分方式不对、问题表达太模糊。
  • 检索错:找到了相似但不相关的内容。
  • 生成错:资料是对的,但模型理解或总结错了。

所以做 RAG 产品时,不只要看模型回答,还要看检索结果、来源引用和失败提示。

六、Tools、Memory 和 MCP:让模型能做事

只会聊天的模型,最多是一个问答入口。真正的 AI 应用通常还要连接工具、记录状态、调用外部系统。

6.1 Tools 是模型可以调用的外部能力

工具可以是:

  • 搜索网页
  • 读取文件
  • 写入表格
  • 运行代码
  • 调用接口
  • 创建待办
  • 发送通知

工具调用让 AI 从“回答问题”走向“完成任务”。但工具越多,权限风险越高,所以必须设计边界。

比如涉及登录、支付、删除、外部发送、权限变更时,不能让模型自动完成,必须加人工确认。

6.2 Memory 是系统保留的状态和偏好

Memory 可以理解成模型或系统记住的信息。它可能包括:

  • 用户偏好
  • 历史任务
  • 项目背景
  • 已完成步骤
  • 待办状态

但记忆不是越多越好。真正有用的记忆应该服务任务,比如“这个项目统一用中文写文档”“输出表格要包含负责人和截止日期”。

不该记的内容也要避免记,比如敏感数据、临时信息、错误结论。

6.3 MCP 是连接工具的一种标准接口

MCP 可以先用一个比喻理解:

它像 AI 工具世界里的通用插口,让模型更标准地连接文件、数据库、浏览器、代码仓库和各种外部服务。

它解决的是“连接方式标准化”的问题。没有标准时,每个工具都要单独适配;有了标准,模型和工具之间的协作会更统一。

但 MCP 不会自动消除幻觉,也不会自动保证任务成功。它只是让连接工具更规范,真正可靠还要靠权限设计、流程设计和验收设计。

七、Workflow 和 Agent:固定流程与动态推进

这两个词经常被混用,但产品设计时一定要分清。

7.1 Workflow 是固定流程

Workflow 更像流水线。步骤提前设计好,每次大致按同样顺序执行。

比如一个资料整理工作流:

1上传资料 -> 提取标题 -> 总结重点 -> 输出表格 -> 生成结论
它的优点是稳定、好控、容易排错。适合规则明确、流程重复、结果格式稳定的任务。

7.2 Agent 是围绕目标动态推进

Agent 更像一个能根据情况调整步骤的任务执行系统。

比如你让它做竞品调研,它可能会:

  • 先确认竞品范围。
  • 搜索公开资料。
  • 打开网页提取信息。
  • 发现资料不足后换关键词。
  • 整理对比表。
  • 标记待核验内容。
  • 输出简报。

Agent 的关键不是“会聊天”,而是能围绕目标拆任务、调工具、保存状态、处理异常,并在关键动作前请求确认。

7.3 判断该用 Workflow 还是 Agent

可以用一个简单判断:

  • 步骤固定、输入稳定、结果格式明确:优先 Workflow。
  • 路径不固定、需要补资料、要处理异常:更接近 Agent。

初学者不要一上来就追求 Agent。很多真实业务场景,用清楚的 Workflow 反而更可靠。

八、普通人应该按什么顺序学

如果你是零基础,建议按这个顺序:

  • 先理解大模型是什么,不急着追最新工具。
  • 学会写清楚 Prompt,把任务、材料、边界和输出标准说清。
  • 理解 Token 和上下文,知道为什么长材料要分段处理。
  • 理解幻觉,养成来源、核验、人工确认的习惯。
  • 学 RAG,知道知识库问答为什么要先检索再生成。
  • 学 Workflow,把重复任务做成稳定流程。
  • 最后学 Agent,让模型在有边界的情况下动态完成任务。

这个顺序能避免一种很常见的问题:名词都会说,但遇到真实任务不知道该用哪一层能力。

九、学完这篇你应该能做什么

读完这篇,不要求你马上开发一个完整 AI 系统,但至少应该能完成 4 件事:

  • 看到一个 AI 产品时,能说出它主要用了哪些能力。
  • 写 Prompt 时,能主动补充任务、材料、边界和输出标准。
  • 做知识库问答时,能理解为什么要检索、引用来源和标记不确定内容。
  • 看到 Agent 宣传时,能判断它是真能拆任务和调工具,还是只是套了一个聊天入口。

最后记住一句话:

AI 学习的第一步不是追工具,而是知道每个概念到底解决哪一层问题。

十、参考来源与延伸阅读

  • OpenAI 官方文档:用于理解大模型、工具调用和应用开发基础。
  • Anthropic MCP 相关资料:用于理解模型连接外部工具的标准化思路。
  • 本地素材库:01 人工智能产品学习知识库/索引资料,用于追溯视频素材和主题提炼。