AI 入门概念笔记
给'老记不住'的自己整理的一份 AI 概念速记 —— LLM、Tool、MCP、Agent,从零件到组装到全景地图。
给”老记不住”的自己。每个概念配一个比喻当记忆钩子 —— 先记住比喻,细节自然就回来了。
阅读顺序就是理解顺序:先搞懂「零件」(LLM、工具),再搞懂「组装」(Agent),最后看「全景地图」。
一、核心比喻表(忘了就先看这个)
| 概念 | 一句话 | 比喻 |
|---|---|---|
| LLM | 会思考、但只能”想一次”的脑子 | 纯粹的思维能力 |
| 工具 / Tool | 让脑子能真的”动手”的能力 | 手 |
| MCP | 连接外部世界的统一接口标准 | USB 标准(插口规范) |
| MCP 服务器 | 连接某一个具体系统的程序 | 插到 USB 上的某个设备 / App |
| MCP Registry | MCP 服务器的目录 | App Store |
| Agent | 脑子 + 手 + “想-做-看”循环 + 目标 | 一个会干活的员工 |
一句话把它们串起来:
Agent(员工)用 LLM(脑子)思考,通过工具 / MCP(手和插口)去操作真实系统,靠”想 → 做 → 看结果 → 再想”的循环,把一件事从头干完。
二、LLM(大语言模型)
- 是什么:文字进、文字出的引擎。你给一段话,它生成一段回答,就结束了。
- 它不能做什么:不能自己运行代码、不能查看结果、不能根据结果再调整、不能连着做好几步。
- 比喻:一个纯粹的”大脑”,只会在被问到时”想一次”,想完就停。
记忆钩子:LLM = 只会想一次的脑子。
三、工具(Tool)与 MCP
工具 / Tool
- 让 LLM 能”动手”的函数:发邮件、查数据库、改文件、调 API……
- 模型决定要不要调、传什么参数,工具负责真正执行并把结果返回。
- 比喻:脑子的”手”。
MCP(Model Context Protocol,模型上下文协议)
- 是什么:一套统一的连接标准,让 AI 能安全地接到外部数据和工具。
- 为什么需要:没有它,每个 AI 应用接每个工具都要单独开发(M × N 套对接);有了统一标准后变成 M + N。
- 比喻:USB 标准。全世界一个接口规范 —— 这是”一套”。
MCP 服务器
- 是什么:一个具体的程序,负责连接某一个外部系统(GitHub 的、数据库的、Notion 的……)。
- 关键:每个服务器只懂一个系统,彼此不能替代。所以服务器有很多个。
- 一般对外提供三样东西:
- 工具(Tools):让模型”做事”的函数(最常用)
- 资源(Resources):让模型”读取”的数据
- 提示词(Prompts):可复用的提示模板
- 比喻:插到 USB 上的各种设备(键盘、打印机、U 盘)。接口统一,但每个干的活不一样。
记忆钩子:MCP 是”一套”标准;MCP 服务器是”很多个”设备。
顺带记住
- Claude 里的”连接器(Connectors)“背后就是 MCP。你连 Google Drive、Gmail 时,已经在用 MCP 了。
- GitHub MCP Registry(
github.com/mcp)= MCP 服务器的”App Store”,用来集中查找和安装。
四、Agent(智能体)—— 重点别和 LLM 搞混
- 是什么:围绕 LLM 搭起来的一整套系统。LLM 是它体内的脑子,但光有脑子不算 Agent。
- Agent = LLM + 工具 + “想-做-看”循环 + 目标管理。
Agent 的核心:那个循环
把对话发给模型 → 模型说”我要调工具 X” → 代码真的执行工具 X → 把结果塞回对话 → 再发给模型 → 直到模型说”搞定了”。
这个 “调用 → 执行 → 喂回 → 再调用”的 while 循环,就是 Agent 的全部精髓。核心代码几十行就能写出来。
LLM vs Agent 一眼区分(用”修 bug”举例)
- 纯 LLM:看一眼代码,输出”你应该这样改”的建议。没法真去改、去跑测试、去验证。
- Agent:读文件 → 改代码 → 跑测试 → 看到挂了 → 判断 → 再改 → 再跑…… 循环到测试通过为止。
记忆钩子:LLM 只”想一次”;Agent 会”想-做-看”地循环干活。
五、AI 技术全景地图(我玩的这套,只是其中一块)
把整个领域想象成一个”栈” + 旁边几个”平行世界”。
┌─────────────────────────────┐
最上层 │ 应用 / 编排层 │ ← Agent 循环、MCP、调模型(我现在在学的)
├─────────────────────────────┤
中间层 │ 模型本身(训练好的 LLM) │
├─────────────────────────────┤
最底层 │ 造模型:预训练 + 后训练 │ ← 真正的"硬核腹地"
└─────────────────────────────┘
旁边平行站着的"另外的世界":
· 图像生成(扩散模型,架构完全不同)
· 语音(识别 / 合成)、视频生成
· 传统 / 非生成式 ML(推荐系统、风控、医疗影像、XGBoost…… 工业界大头)
· 强化学习 / 机器人 / 具身智能
· 检索与记忆(embedding 向量、向量库、RAG)
· 支撑层 MLOps(训练 / 部署 / 评测 / 量化)+ 评估与对齐安全
Agent 循环覆盖的:只是最上层”在文本大模型之上做应用 / 编排”。
它没碰到的:脚下的”模型怎么训出来的”(预训练、SFT、RLHF、推理训练 RL),以及旁边那一整排平行世界。
记忆钩子:我玩的是”用模型”;更底层是”造模型”;旁边还有一堆”别的模型”。
另一根杠杆:微调(Fine-tune)
- 不只是”prompt 模型”,还可以改变模型本身的行为。
- 跟搭 Agent 是两个完全不同的方向:Agent 是用现成模型,微调是改造模型。
六、权限与安全(重要,别掉以轻心)
一个关键事实(也是安心点)
- MCP 服务器是借用你的身份和凭证去操作的。
- 你自己进不去的平台,接 MCP 也进不去 —— 它不会、也无法帮你绕过权限。
真实风险
- 权限太大:能”写”就能误删、误改。读取通常安全,写 / 删要小心。
- 服务器可信度:来路不明的第三方服务器拿到你的令牌可能滥用。
- 提示词注入(prompt injection):AI 读到的网页 / issue 里藏了假指令,设计不好的系统可能被骗去执行。危险不一定来自你。
防线 / 实操建议
- 只想”看 / 分析” → 给只读权限,风险很低。
- 要”动手改” → 开逐步确认(每次动手前先问你)+ 最小权限令牌(只授权单个仓库 / 只读)。
- 只用可信来源(官方出品 > 不认识的人写的)。
- 自己写服务器反而更安全:代码你写的,可以硬性限制”只能查、不能删”。
记忆钩子:先从只读、低风险场景试起,熟了再放权。
七、语言与工具选型(给 Java 开发者)
大局
- Python:主导”模型 / 研究层”(微调、训练、传统 ML)。做研究绕不开。生态最深(PyTorch、Hugging Face)。
- TypeScript:在”应用 / 编排层”崛起最快,2025 年成 GitHub 第一语言。适合做 AI Web 产品(前后端 + AI 一套语言)。
- Java:应用 / 编排层也能完整做(见下)。“造模型”这层基本空白。
Java 能做的(不用换语言就能起步)
- MCP:官方
io.modelcontextprotocol.sdk:mcp(1.0 正式版,和 Spring AI 合作维护)。 - Agent 框架:Spring AI 或 LangChain4j。
- 本地模型:Ollama,Java 端用 Spring AI / LangChain4j 连。
选型决策
| 你的目标 | 推荐 |
|---|---|
| 求稳、复用现有技能 | Java(Spring AI)先把概念吃透 |
| 做 AI Web 产品 / 跟最热应用层生态 | TypeScript |
| 迟早碰模型本身(微调 / 训练) | Python(可等真用到时再学) |
记忆钩子:用模型那层啥语言都行;碰模型那层必须 Python。
八、本地跑模型(我的 4070S,12GB 显存)
- 工具:Ollama(一行命令拉模型)。
- 能跑:7B~8B 量化模型很舒服,14B 紧一点也行。
- 选模型:挑**支持工具调用(function calling)**的,如 Qwen2.5-7B、Llama 3.1 8B。
- 预防针:小模型做 Agent 可靠性不如前沿模型,容易想歪、参数错、循环停不下来。适合学原理 / 玩具项目,别指望生产级稳。
九、给迷茫时的自己
- “迷茫”是正常的,连业内人都有。领域太快太大,看到地图变大 = 在进步,不是掉队。
- 没人能”跟上”全部。框架是浪花,会一茬茬换;底层概念几年不变。打好底子 + 会快速学新东西,才是真本事。
- Java 功底是资产:AI 越能写代码,稀缺的越是”工程判断力” —— 系统设计、排查问题、看方案靠不靠谱。这些学不来。
- 解药不是”再多看资料”,而是”动手做一个小东西”。亲手把一个最小项目跑通,雾会散一大半。
下一步(低压力)
做一个最小 demo:本地模型(Ollama)+ 手写 Agent 循环 + 一个自定义 MCP 服务器, 场景就用”操作我电脑上的某个文件夹” —— 零权限、零风险, 第一次亲眼看见 LLM + Agent + 工具 怎么咬合转起来。
笔记会随学习更新。先记比喻,再记细节。不急,慢慢来。