AI 世界地图

基础 · 01 / 04

刚接触 AI 的时候,最晕的不是不会用,是分不清谁是谁——Codex 到底是个 App 还是个模型? Claude 和 Claude Code 什么关系?Skills 和 Agent 是一回事吗? 这些问题解不开,是因为它们本来就不在同一层。把三层叠起来看,一眼就清楚了。

一句话的旅程你在 Codex 里说「帮我写一个芦苇荡的古风提示词」,接下来发生了什么 —— 点一站看一站
应用在显示
机制在传
模型在算
应用在显示
第 1 站 · 应用 · 在显示
你在 Codex 里打字,按下发送
帮我写一个芦苇荡的古风提示词

到这里为止,一切只发生在屏幕上。Codex 自己不会思考,它是个壳——但 Skills 和 Agent 都装在这个壳里,下一站就用上。

第 2 站 · 应用 · 在显示
Codex 翻开对上号的那本手册——这就是 Skills
装在 Codex 里的手册布光古风提示词写剧本古风提示词手册 · 整本翻开目录里每本只写书名和一句「什么时候用」;你说的话对上了哪本,才把那本整本翻开。

Skills 装在应用里:你在课前准备里装进 Codex 的,就是这一本本手册。Codex 每次都带着一份手册目录——有哪些手册、各管什么。你要的是古风提示词,「古风提示词」这本对得上,就整本翻开。里面写着该怎么想、按什么顺序写、哪些词绝对不能用。对不上的手册不会翻开,所以装再多 Skills,也不会每句话都背着全部内容。细一点说:「对上号」这一下,其实是模型看目录判断的;手册在 Codex 里,由 Codex 翻开、递下去。你不用点名,说人话就行。

第 3 站 · 机制 · 在传
你的话、翻开的手册、之前聊过的,一起打包——这叫「上下文」(Context)
最早的话Codex 的规矩古风提示词手册昨天聊过布光……帮我写一个芦苇荡的古风提示词装这一包的地方叫「上下文窗口」,有上限。装满了,最前面的先被挤掉——聊久了它开始忘事,就是这个原因。
虚线那格就是上一站翻开的手册,也一起装进来。

模型拿到的不只是你那句话:之前聊过的内容、Codex 自己的规矩、上一站翻开的手册,会和这句话一起打包——这一整包叫上下文(Context),也就是模型真正读到的那段「提示词」。所以它才「记得」你昨天聊过什么。窗口里有什么,模型就只知道什么;挤出去的,它就真的忘了。

第 4 站 · 机制 · 在传
整包切成 token,算一算有多重
帮我一个芦苇古风提示词手册 · 上千个 token你那句话十几个 token;一本手册常常上千。装进来的越多,越贵、越占窗口。

模型不认字,只认 token。贵不贵、能记多少,全按 token 数。手册也要算:一本手册常常比你那句话重几十倍。这就是为什么目录只写一句话、用到才翻开——省 token,也省窗口。

第 5 站 · 模型 · 在算
整包送进模型,模型照手册的规矩写
GPT 系模型Acinematicwuxiaphotograph一个 token 一个 token 往外吐,所以你看到它「一个字一个字」地打。

这是唯一在思考的一层,它没有界面,你看不见它。它按手册的规矩写:先定光、再定镜头、不写「8K」这类没用的词——这些规矩不是它自己想的,是手册里写的。注意:Codex 是应用的名字,背后在算的是 GPT 系模型——同一个工具,壳和引擎不是一回事。

第 6 站 · 应用 · 在显示
一段英文提示词回到屏幕上
A cinematic wuxia photograph in a vast reed marsh at first light in late autumn. Tall pale reeds fill the frame…

从 1 到 6 是一趟:你说一句人话,拿回一段能直接粘进 Midjourney 的英文提示词。Agent 就是让它自己连着跑很多趟:写完、自己检查一遍参数、改完再交给你。这也是应用的本事——是 Codex 在调度这一趟趟,模型每趟只管算。

1 / 6
第三层应用你打字的那个东西

一个壳。自己不思考,只把你的话转给模型、把结果摆给你看。Skills、Agent 也装在壳里。

判断:你在哪打字,那就是应用。

能动你的文件
Claude Code需网络工具
Anthropic。读写文件、跑命令。
Codex需网络工具
OpenAI。这门课程用它。
WorkBuddy国内直连
腾讯。国内直连,网络不稳时的保底。
只聊天
豆包国内直连
字节。日常问答。
ChatGPT / Claude 网页版需网络工具
网页里对话,不动你的文件。
专做一件事
Midjourney需网络工具
只做图。这门课程出图用它。
LibTV国内直连
LiblibAI 的视频工作台。
装在应用里的本事
Skills
一本工作手册,对上号才翻开。
Agent
自己连着干很多步,再回来交差。
第二层机制应用和模型之间的那段传输

中间那一段。你打的字怎么变成模型能吃的东西、一次能带多少、能从哪接出去够到外面——都发生在这里。 这些词本身不是产品,是传输的零件和规则。听懂这四个,AI 圈九成的话你就能听明白了。

判断方法:它不显示,也不算,它在传。

按传输顺序:你说的话 → 怎么切 → 装进哪 → 从哪接出去
Prompt 提示词
你说的那段话。说得越具体,它猜得越少。整门古风课练的就是这个。
token
AI 读写文字的最小单位。中文一个字大约 1–2 个 token。贵不贵、能记多少,全按它算。
上下文窗口
它一次能同时「看到」多少 token。超出去,最前面的内容就被挤掉了——聊久了它开始忘事,就是这个原因。
MCP
给 AI 插的外接口,让它能连你的网盘、日历、数据库。Skills 是教它怎么做,MCP 是让它够得着。
第一层模型最底下,真正在算的引擎

干活的那个。你看不见它,它没有界面。所有的理解、生成、推理都发生在这一层。 模型分家族,每个家族下面还有一堆型号,型号大致对应「多聪明、多贵、多快」。

判断方法:它在算,不在显示。

文本 / 多模态 —— 读文字、写文字,多数也能看图
GPT 系
OpenAI
Claude 系
Anthropic
Gemini 系
Google
豆包系
字节
DeepSeek 系
深度求索 · 开源
Qwen 系
阿里 · 开源
图像 —— 文字进,图出
Midjourney
审美最稳,我们古风课用的
Seedream
字节
Nano Banana
Google · 擅长在原图上改
视频 —— 文字或图进,会动的东西出
Seedance
字节
Kling 可灵
快手
Veo
Google

型号每季度都在换,这里只记家族名。要具体到版本号,上课时现查。

读完了就点一下。只是给你自己一个收尾,不是考核。