0.写在前面
时隔很久,又开始更新博客了。
过去一年,AI领域的发展速度可以说非常夸张,几乎每隔几个月都会出现新的技术、新的产品以及新的概念。
从最开始大家熟悉的 ChatGPT,到后来火爆的 AI Agent,再到现在经常被提起的 RAG、MCP、Skills 等概念,越来越多的人开始接触AI。但是很多人在了解AI的过程中都会遇到一个问题:
这些概念到底是什么意思?它们之间又有什么关系?
为什么有时候说AI是大模型,有时候又说AI Agent?
为什么企业做AI应用时经常提到RAG?
MCP到底解决了什么问题?
这篇文章会尽可能用简单直白的方式,把这些AI领域常见概念串起来,让大家能够建立一个基础认知。
1.LLM
LLM 是 Large Language Model 的缩写,中文叫做大语言模型。
简单理解: LLM就是目前各种AI聊天产品背后的核心“大脑”。
我们熟悉的 ChatGPT、Claude、Gemini、DeepSeek 等产品,本质上都是基于不同的大语言模型构建出来的。不过需要注意:AI产品名称和背后的模型名称并不一定相同。
一个完整的AI产品通常包含:
模型能力 + 工程系统 + 用户交互 + 安全策略 + 额外功能
所以 ChatGPT 并不等于 GPT 模型本身,而是基于GPT模型打造出来的一套完整AI应用。
下面列举一些常见模型厂商:
| 厂商 | 代表模型 |
|---|---|
| OpenAI | GPT系列 |
| Anthropic | Claude系列(Opus、Sonnet、Haiku) |
| Gemini系列 | |
| DeepSeek | DeepSeek系列 |
| 阿里巴巴 | Qwen(通义千问)系列 |
| 月之暗面 | Kimi系列 |
| 智谱AI | GLM系列 |
| 字节跳动 | Doubao(豆包)系列 |
| MiniMax | MiniMax系列 |
| 阶跃星辰 | Step系列 |
除此之外,还有很多其他模型厂商,这里不再一一列举。
2.多模态
早期的大语言模型主要处理文字。
但是现实世界的信息并不只有文字,图像、声音等同样包含大量信息,因此出现了多模态(Multimodal)能力。
简单来说:
多模态就是AI不仅能理解文字,还能够理解图片、声音、视频等不同类型的信息。
例如:
以前的AI看到一张图片,只能回答:
“这是一张图片。”
而现在支持多模态的大模型可以:
- 分析图片中的内容
- 阅读截图中的文字
- 理解代码截图
- 分析表格
- 总结视频内容
- 根据文字生成图片
这让AI从“文字助手”逐渐变成了能够理解现实世界信息的智能助手。
3.Token
token的概念比较抽象,今年官方给它的中文名称是:词元。
简单来说:
Token是大模型处理文字时拆分出来的最小计算单位。
Token是模型内部理解和处理文本时使用的一种“编码单位”,当用户输入文本之后,首先会通过分词器(Tokenizer)切分文本,然后将文本转换成Token ID(一串数字),得到的Token ID模型可以通过向量层计算出向量结果,再之后模型会给出新的Token作为结果。
很多人会简单理解:
一个Token≈一个字或者一个词
这种理解方便入门,但并不完全准确。
实际上,例如英文文本中的:
Hello world
会被拆分成:
1.Hello [15496]
3.world [995]
对应的Token ID是:[15496, 995]
上面的一个英文单词可以理解为是一个Token,也有一个单词对应多个Token的,比如:
unbelievable
可能会被拆分成
1.un
2.believ
3.able
这里这一个单词会占用3个Token
再比如中文中的:
人工智能
可能会被拆分成:
1.人
2.工
3.智
4.能
也可能会被拆分成
1.人工
2.智能
这样的结果差异是由于模型使用的分词器(Tokenizer)不同,所以不同的LLM可能会有不同的结果。
实际的分词过程可能比上述的要复杂得多,如果感兴趣的话,可以参考下面资料进一步了解:
https://zhuanlan.zhihu.com/p/1929576021297980125
为什么大家经常提到Token呢?
-因为目前大部分LLM API都是按照Token数量进行计费的。
可以把AI模型厂商理解成像电信、移动、联通这样的运营商,而Token就类似:手机套餐里的流量单位。使用AI的API,就像使用手机流量一样:消耗越多,费用越高,并且你的输入输出都在消耗Token,对应了流量的上传和下载。所以在使用AI的过程中,如何减少无效Token消耗,也是非常重要的一项优化工作。
4.Prompt
Prompt 中文一般叫做提示词。简单理解:Prompt就是我们告诉AI“应该如何工作”的指令。
如果把LLM比作一个能力很强的大脑,那么Prompt就是告诉这个大脑:
- 你是谁
- 你要完成什么任务
- 你应该如何思考
- 你应该输出什么结果
如果观察过API结构的同学可以注意到,在调用LLM API时,通常会看到几种不同类型的消息:
1.System Message(System Prompt)
2.User Message
3.Assistant Message
分别代表:
4.1 System Prompt(系统提示词)
System Prompt通常由开发者设置,用于定义AI的基础规则。
例如:
你是一名专业的Java工程师。
回答问题时优先考虑代码安全性。
输出代码时必须包含注释。
通过System Prompt,可以设置AI的:
- 人设
- 背景
- 行为规则
- 输出格式
- 任务目标
4.2 User Message(用户消息)
就是用户实际输入的问题。
例如:
帮我设计一个订单系统
4.3 Assistant Message(助手消息)
就是AI返回的内容。
4.4 提示词工程(Prompt Engineering)
在实际AI应用开发中,如何设计Prompt是一项非常重要的工作,这也被称为:提示词工程(Prompt Engineering)。一个优秀的Prompt需要包含几个重要部分,参考在阿里百炼平台中建议,提示词最好由以下几个部分构成:
- 背景: 介绍与任务紧密相关的背景信息。这一环节有助于LLM深入理解讨论的具体环境,从而保证其生成内容与话题高度相关。
- 目的: 明确指出您期望LLM完成的具体任务。通过设定清晰、精确的目标指令,可引导LLM聚焦于实现既定任务,提升输出的有效性。
- 风格: 指定您希望 LLM 输出的写作风格,可以是某个具体名人、具体流派或者某类专家的写作风格。
- 语气: 定义输出内容应有的语气,比如正式、诙谐、温馨、关怀等,以便适应不同的使用场景和使用目的。
- 受众: 明确指出内容面向的读者群体,无论是专业人士、入门学习者还是儿童等,这样LLM就能调整语言和内容深度,使之更加贴合受众需求。
- 输出: 规定输出内容的具体形式,确保LLM提供的成果能直接满足后续应用的需求,比如列表、JSON数据格式、专业分析报告等形式。
例如:
#背景#
我想为公司的新产品做广告。我公司的名字叫XXX,产品叫XXXX,是一个xxxxxxx的产品。
#目的#
为我创建一个微博帖子(限制:500字),旨在让人们有兴趣点击产品链接购买。
#风格#
遵循XX等成功公司为类似产品做广告的写作风格。
#语气#
有说服力
#受众#
我公司在微博上的受众通常是年轻一辈人。定制你的帖子,保证喜欢数码产品的人能快速关注到你的帖子。
#输出#
微博上的帖子,简洁而有影响力。
学会优化、调试提示词是目前使用AI的必备技能。
5.Agent
Agent是智能体或者AI智能体(AI Agent)。
这是近一年AI领域非常热门的概念,他与我们熟知的豆包,ChatGPT,千问又有什么差别?
普通LLM更像:一个会聊天、会思考的助手。
但是它通常只能:
- 接收输入
- 生成回答
例如:
用户:
帮我写一份周报
LLM:
(生成了一份周报)
而Agent的目标是:让AI不仅能够回答问题,还能够主动规划任务,并调用工具完成事情。
例如:
用户:
帮我整理一下我这周的工作,并发送给老板。
一个Agent可能会:

这就是Agent和普通聊天机器人的区别。
一个比较完整的AI Agent通常包含以下几个部分:
5.1 LLM(大模型)
负责:
- 理解任务
- 推理分析
- 制定计划
相当于Agent的大脑。
5.2 Prompt
负责定义:
- Agent是谁
- 它应该如何工作
- 它需要遵守什么规则
相当于Agent的行为准则。
5.3 Tools(工具)
让AI具备执行能力。
例如:
- 查询数据库
- 调用接口
- 搜索网页
- 操作文件
- 发送消息
如果没有工具,AI只能“说”,有了工具,AI才能“做”。
5.4 Memory(记忆)
让AI能够保存上下文。
例如:
第一次聊天:
用户:
我是Java开发工程师。
以后:
用户:
帮我优化代码。
AI可以结合之前的信息,知道用户更关注Java技术方案。
5.5 Planning(规划)
这是Agent区别于普通LLM的重要能力。
复杂任务通常不能一步完成。
Agent需要:

这也是为什么现在很多人认为:Agent是AI应用发展的下一阶段。
6.Skills
Skills又称技能,这个概念是去年下半年比较热门的,在今年年初时OpenClaw风靡的过程中再次被经常提及。
简单来说:Skill就是给Agent增加的一项“专业能力”。
不同平台对于Skill的实现方式可能不同。
在很多Agent框架中,一个Skill通常包含:
- 技能描述
- 使用规则
- Prompt模板
- 执行流程
- 相关资源
从本质上来说:
Skill可以理解为:一份告诉AI“如何完成某类任务”的能力说明。
不过需要注意:
如果大量Skill全部加载给LLM,会产生额外Token消耗。因此目前很多Agent系统采用这样的方式优化Token消耗:

7.RAG
RAG全称是Retrieval-Augmented Generation,中文一般译为检索增强生成,这项技术在早期的Agent搭建过程中经常被用到,尤其是智能客服一类的Agent,在我早期的文章中也重点介绍过这项技术。
RAG的过程可以简化为:
用户输入的问题->通过向量计算后,去向量库等知识库中寻找契合的答案->获得答案后,结合用户的问题一起丢给LLM让其回答。
这样的流程可以明显感觉到如果从知识库中获取答案的效果不理想(没能找到契合的答案时),那么LLM的回答也不会准确,甚至如果获得的答案和问题偏差太多,可能会导致LLM出现幻觉。所以一般目前RAG的优化方案都是从知识库的方面入手,尽可能让向量检索到的答案能够完美解答用户的问题。
RAG 使得大模型能够胜任许多专业性强、需要最新资讯的工作:
- 智能客服与企业知识库:员工和客户可以通过对话快速查找公司产品手册、内部规章制度或报销流程,AI 回答准确且能提供文档出处。
- 医疗问答:辅助医生或患者查询最新的医学指南或个人病史。
- 法律与金融分析:让 AI 结合最新的法律条文、判例或财报进行合规检查和数据分析。
需要注意的是,很多人认为:做RAG就是接一个向量数据库。实际上,目前一个高质量RAG系统涉及很多环节:

这其中任何一个环节效果不好,都可能影响最终回答质量。所以现在RAG优化通常不仅仅关注数据库,而是整个检索和生成链路。
8.MCP
MCP全称是Model Context Protocol,是一种模型上下文协议,由 Anthropic 在 2024 年底推出的一项开源开放标准。
简单点理解,MCP相当于一个标准的API接口,所有的LLM都能读懂他(标准化)。当接入LLM后,有需要的时候,LLM可以来调用这个API获取需要的资源或者拓展额外的能力。有点像Type-C接口统一了所有充电口一样,MCP统一了所有LLM接入工具的方式,以及工具的开发方式。
MCP的运行逻辑:MCP服务注册后,LLM会收到MCP的自述内容:能做什么事情、能获得什么样的结果、需要哪些条件才能做这些事情。

比如,一个数据库MCP服务,可以告诉AI:
1.我可以查询用户的订单信息。
当Agent可能遇到需要查询某个用户的订单时,发现需要数据库查询的能力,于是会调用MCP服务,查询某个用户的数据并根据数据回复。
所以,MCP解决的是:AI如何标准化连接外部世界的问题。
9.最后
AI的发展速度非常快。今天我们讨论的这些概念,可能过几年又会出现新的变化。但是无论技术如何发展,核心逻辑其实没有改变:
让AI拥有更强的理解能力、更丰富的知识、更强的执行能力,以及连接现实世界的能力。
从LLM到Agent,再到未来更加智能的AI系统,本质上都是在不断扩展AI能够完成任务的范围。
希望这篇文章能够帮助大家建立一个AI技术地图,在面对各种新概念时,不再只是听过名字,而是真正理解它们解决的问题是什么。