AI

搞懂AI时代这些关键词:LLM、Token、Agent、RAG、MCP到底是什么?

一文搞懂 LLM、Token、Agent、RAG、MCP 等核心概念

Posted by catmai on July 12, 2026

0.写在前面

时隔很久,又开始更新博客了。

过去一年,AI领域的发展速度可以说非常夸张,几乎每隔几个月都会出现新的技术、新的产品以及新的概念。

从最开始大家熟悉的 ChatGPT,到后来火爆的 AI Agent,再到现在经常被提起的 RAG、MCP、Skills 等概念,越来越多的人开始接触AI。但是很多人在了解AI的过程中都会遇到一个问题:

这些概念到底是什么意思?它们之间又有什么关系?

为什么有时候说AI是大模型,有时候又说AI Agent?

为什么企业做AI应用时经常提到RAG?

MCP到底解决了什么问题?

这篇文章会尽可能用简单直白的方式,把这些AI领域常见概念串起来,让大家能够建立一个基础认知。

1.LLM

LLM 是 Large Language Model 的缩写,中文叫做大语言模型

简单理解: LLM就是目前各种AI聊天产品背后的核心“大脑”。

我们熟悉的 ChatGPT、Claude、Gemini、DeepSeek 等产品,本质上都是基于不同的大语言模型构建出来的。不过需要注意:AI产品名称和背后的模型名称并不一定相同。

一个完整的AI产品通常包含:

模型能力 + 工程系统 + 用户交互 + 安全策略 + 额外功能

所以 ChatGPT 并不等于 GPT 模型本身,而是基于GPT模型打造出来的一套完整AI应用。

下面列举一些常见模型厂商:

厂商 代表模型
OpenAI GPT系列
Anthropic Claude系列(Opus、Sonnet、Haiku)
Google Gemini系列
DeepSeek DeepSeek系列
阿里巴巴 Qwen(通义千问)系列
月之暗面 Kimi系列
智谱AI GLM系列
字节跳动 Doubao(豆包)系列
MiniMax MiniMax系列
阶跃星辰 Step系列

除此之外,还有很多其他模型厂商,这里不再一一列举。

2.多模态

早期的大语言模型主要处理文字。

但是现实世界的信息并不只有文字,图像、声音等同样包含大量信息,因此出现了多模态(Multimodal)能力。

简单来说:

多模态就是AI不仅能理解文字,还能够理解图片、声音、视频等不同类型的信息。

例如:

以前的AI看到一张图片,只能回答:

“这是一张图片。”

而现在支持多模态的大模型可以:

  • 分析图片中的内容
  • 阅读截图中的文字
  • 理解代码截图
  • 分析表格
  • 总结视频内容
  • 根据文字生成图片

这让AI从“文字助手”逐渐变成了能够理解现实世界信息的智能助手。

3.Token

token的概念比较抽象,今年官方给它的中文名称是:词元。

简单来说:

Token是大模型处理文字时拆分出来的最小计算单位。

Token是模型内部理解和处理文本时使用的一种“编码单位”,当用户输入文本之后,首先会通过分词器(Tokenizer)切分文本,然后将文本转换成Token ID(一串数字),得到的Token ID模型可以通过向量层计算出向量结果,再之后模型会给出新的Token作为结果。

很多人会简单理解:

一个Token≈一个字或者一个词

这种理解方便入门,但并不完全准确。

实际上,例如英文文本中的:

Hello world

会被拆分成:

1.Hello [15496]
3.world [995]

对应的Token ID是:[15496, 995]

上面的一个英文单词可以理解为是一个Token,也有一个单词对应多个Token的,比如:

unbelievable

可能会被拆分成

1.un
2.believ
3.able

这里这一个单词会占用3个Token


再比如中文中的:

人工智能

可能会被拆分成:

1.人
2.工
3.智
4.能

也可能会被拆分成

1.人工
2.智能

这样的结果差异是由于模型使用的分词器(Tokenizer)不同,所以不同的LLM可能会有不同的结果。

实际的分词过程可能比上述的要复杂得多,如果感兴趣的话,可以参考下面资料进一步了解:

https://zhuanlan.zhihu.com/p/1929576021297980125


为什么大家经常提到Token呢?

-因为目前大部分LLM API都是按照Token数量进行计费的。

可以把AI模型厂商理解成像电信、移动、联通这样的运营商,而Token就类似:手机套餐里的流量单位。使用AI的API,就像使用手机流量一样:消耗越多,费用越高,并且你的输入输出都在消耗Token,对应了流量的上传和下载。所以在使用AI的过程中,如何减少无效Token消耗,也是非常重要的一项优化工作。

4.Prompt

Prompt 中文一般叫做提示词。简单理解:Prompt就是我们告诉AI“应该如何工作”的指令。

如果把LLM比作一个能力很强的大脑,那么Prompt就是告诉这个大脑:

  • 你是谁
  • 你要完成什么任务
  • 你应该如何思考
  • 你应该输出什么结果

如果观察过API结构的同学可以注意到,在调用LLM API时,通常会看到几种不同类型的消息:

1.System Message(System Prompt)
2.User Message
3.Assistant Message

分别代表:

4.1 System Prompt(系统提示词)

System Prompt通常由开发者设置,用于定义AI的基础规则。

例如:

你是一名专业的Java工程师。
回答问题时优先考虑代码安全性。
输出代码时必须包含注释。

通过System Prompt,可以设置AI的:

  • 人设
  • 背景
  • 行为规则
  • 输出格式
  • 任务目标

4.2 User Message(用户消息)

就是用户实际输入的问题。

例如:

帮我设计一个订单系统

4.3 Assistant Message(助手消息)

就是AI返回的内容。

4.4 提示词工程(Prompt Engineering)

在实际AI应用开发中,如何设计Prompt是一项非常重要的工作,这也被称为:提示词工程(Prompt Engineering)。一个优秀的Prompt需要包含几个重要部分,参考在阿里百炼平台中建议,提示词最好由以下几个部分构成:

  • 背景: 介绍与任务紧密相关的背景信息。这一环节有助于LLM深入理解讨论的具体环境,从而保证其生成内容与话题高度相关。
  • 目的: 明确指出您期望LLM完成的具体任务。通过设定清晰、精确的目标指令,可引导LLM聚焦于实现既定任务,提升输出的有效性。
  • 风格: 指定您希望 LLM 输出的写作风格,可以是某个具体名人、具体流派或者某类专家的写作风格。
  • 语气: 定义输出内容应有的语气,比如正式、诙谐、温馨、关怀等,以便适应不同的使用场景和使用目的。
  • 受众: 明确指出内容面向的读者群体,无论是专业人士、入门学习者还是儿童等,这样LLM就能调整语言和内容深度,使之更加贴合受众需求。
  • 输出: 规定输出内容的具体形式,确保LLM提供的成果能直接满足后续应用的需求,比如列表、JSON数据格式、专业分析报告等形式。

例如:

#背景#

我想为公司的新产品做广告。我公司的名字叫XXX,产品叫XXXX,是一个xxxxxxx的产品。

#目的#

为我创建一个微博帖子(限制:500字),旨在让人们有兴趣点击产品链接购买。

#风格#

遵循XX等成功公司为类似产品做广告的写作风格。

#语气#

有说服力

#受众#

我公司在微博上的受众通常是年轻一辈人。定制你的帖子,保证喜欢数码产品的人能快速关注到你的帖子。

#输出#

微博上的帖子,简洁而有影响力。

学会优化、调试提示词是目前使用AI的必备技能。

5.Agent

Agent是智能体或者AI智能体(AI Agent)。

这是近一年AI领域非常热门的概念,他与我们熟知的豆包,ChatGPT,千问又有什么差别?

普通LLM更像:一个会聊天、会思考的助手。

但是它通常只能:

  1. 接收输入
  2. 生成回答

例如:

用户:
帮我写一份周报

LLM:
(生成了一份周报)

而Agent的目标是:让AI不仅能够回答问题,还能够主动规划任务,并调用工具完成事情。

例如:

用户:

帮我整理一下我这周的工作,并发送给老板。

一个Agent可能会:

这就是Agent和普通聊天机器人的区别。

一个比较完整的AI Agent通常包含以下几个部分:

5.1 LLM(大模型)

负责:

  • 理解任务
  • 推理分析
  • 制定计划

相当于Agent的大脑。


5.2 Prompt

负责定义:

  • Agent是谁
  • 它应该如何工作
  • 它需要遵守什么规则

相当于Agent的行为准则。


5.3 Tools(工具)

让AI具备执行能力。

例如:

  • 查询数据库
  • 调用接口
  • 搜索网页
  • 操作文件
  • 发送消息

如果没有工具,AI只能“说”,有了工具,AI才能“做”。


5.4 Memory(记忆)

让AI能够保存上下文。

例如:

第一次聊天:

用户:
我是Java开发工程师。

以后:

用户:
帮我优化代码。

AI可以结合之前的信息,知道用户更关注Java技术方案。


5.5 Planning(规划)

这是Agent区别于普通LLM的重要能力。

复杂任务通常不能一步完成。

Agent需要:

这也是为什么现在很多人认为:Agent是AI应用发展的下一阶段。

6.Skills

Skills又称技能,这个概念是去年下半年比较热门的,在今年年初时OpenClaw风靡的过程中再次被经常提及。

简单来说:Skill就是给Agent增加的一项“专业能力”。

不同平台对于Skill的实现方式可能不同。

在很多Agent框架中,一个Skill通常包含:

  • 技能描述
  • 使用规则
  • Prompt模板
  • 执行流程
  • 相关资源

从本质上来说:

Skill可以理解为:一份告诉AI“如何完成某类任务”的能力说明。

不过需要注意:

如果大量Skill全部加载给LLM,会产生额外Token消耗。因此目前很多Agent系统采用这样的方式优化Token消耗:

7.RAG

RAG全称是Retrieval-Augmented Generation,中文一般译为检索增强生成,这项技术在早期的Agent搭建过程中经常被用到,尤其是智能客服一类的Agent,在我早期的文章中也重点介绍过这项技术。

RAG的过程可以简化为:

用户输入的问题->通过向量计算后,去向量库等知识库中寻找契合的答案->获得答案后,结合用户的问题一起丢给LLM让其回答。

这样的流程可以明显感觉到如果从知识库中获取答案的效果不理想(没能找到契合的答案时),那么LLM的回答也不会准确,甚至如果获得的答案和问题偏差太多,可能会导致LLM出现幻觉。所以一般目前RAG的优化方案都是从知识库的方面入手,尽可能让向量检索到的答案能够完美解答用户的问题。

RAG 使得大模型能够胜任许多专业性强、需要最新资讯的工作:

  • 智能客服与企业知识库:员工和客户可以通过对话快速查找公司产品手册、内部规章制度或报销流程,AI 回答准确且能提供文档出处。
  • 医疗问答:辅助医生或患者查询最新的医学指南或个人病史。
  • 法律与金融分析:让 AI 结合最新的法律条文、判例或财报进行合规检查和数据分析。

需要注意的是,很多人认为:做RAG就是接一个向量数据库。实际上,目前一个高质量RAG系统涉及很多环节:

这其中任何一个环节效果不好,都可能影响最终回答质量。所以现在RAG优化通常不仅仅关注数据库,而是整个检索和生成链路。

8.MCP

MCP全称是Model Context Protocol,是一种模型上下文协议,由 Anthropic 在 2024 年底推出的一项开源开放标准。

简单点理解,MCP相当于一个标准的API接口,所有的LLM都能读懂他(标准化)。当接入LLM后,有需要的时候,LLM可以来调用这个API获取需要的资源或者拓展额外的能力。有点像Type-C接口统一了所有充电口一样,MCP统一了所有LLM接入工具的方式,以及工具的开发方式。

MCP的运行逻辑:MCP服务注册后,LLM会收到MCP的自述内容:能做什么事情、能获得什么样的结果、需要哪些条件才能做这些事情。

比如,一个数据库MCP服务,可以告诉AI:

1.我可以查询用户的订单信息。

当Agent可能遇到需要查询某个用户的订单时,发现需要数据库查询的能力,于是会调用MCP服务,查询某个用户的数据并根据数据回复。

所以,MCP解决的是:AI如何标准化连接外部世界的问题。

9.最后

AI的发展速度非常快。今天我们讨论的这些概念,可能过几年又会出现新的变化。但是无论技术如何发展,核心逻辑其实没有改变:

让AI拥有更强的理解能力、更丰富的知识、更强的执行能力,以及连接现实世界的能力。

从LLM到Agent,再到未来更加智能的AI系统,本质上都是在不断扩展AI能够完成任务的范围。

希望这篇文章能够帮助大家建立一个AI技术地图,在面对各种新概念时,不再只是听过名字,而是真正理解它们解决的问题是什么。