AI 入门概念笔记

AI 入门概念笔记

给'老记不住'的自己整理的一份 AI 概念速记 —— LLM、Tool、MCP、Agent,从零件到组装到全景地图。

给”老记不住”的自己。每个概念配一个比喻当记忆钩子 —— 先记住比喻,细节自然就回来了。

阅读顺序就是理解顺序:先搞懂「零件」(LLM、工具),再搞懂「组装」(Agent),最后看「全景地图」。

一、核心比喻表(忘了就先看这个)

概念一句话比喻
LLM会思考、但只能”想一次”的脑子纯粹的思维能力
工具 / Tool让脑子能真的”动手”的能力
MCP连接外部世界的统一接口标准USB 标准(插口规范)
MCP 服务器连接某一个具体系统的程序插到 USB 上的某个设备 / App
MCP RegistryMCP 服务器的目录App Store
Agent脑子 + 手 + “想-做-看”循环 + 目标一个会干活的员工

一句话把它们串起来:

Agent(员工)用 LLM(脑子)思考,通过工具 / MCP(手和插口)去操作真实系统,靠”想 → 做 → 看结果 → 再想”的循环,把一件事从头干完。


二、LLM(大语言模型)

  • 是什么:文字进、文字出的引擎。你给一段话,它生成一段回答,就结束了
  • 它不能做什么:不能自己运行代码、不能查看结果、不能根据结果再调整、不能连着做好几步。
  • 比喻:一个纯粹的”大脑”,只会在被问到时”想一次”,想完就停。

记忆钩子:LLM = 只会想一次的脑子。


三、工具(Tool)与 MCP

工具 / Tool

  • 让 LLM 能”动手”的函数:发邮件、查数据库、改文件、调 API……
  • 模型决定要不要调、传什么参数,工具负责真正执行并把结果返回。
  • 比喻:脑子的”手”。

MCP(Model Context Protocol,模型上下文协议)

  • 是什么:一套统一的连接标准,让 AI 能安全地接到外部数据和工具。
  • 为什么需要:没有它,每个 AI 应用接每个工具都要单独开发(M × N 套对接);有了统一标准后变成 M + N。
  • 比喻:USB 标准。全世界一个接口规范 —— 这是”一套”。

MCP 服务器

  • 是什么:一个具体的程序,负责连接某一个外部系统(GitHub 的、数据库的、Notion 的……)。
  • 关键:每个服务器只懂一个系统,彼此不能替代。所以服务器有很多个。
  • 一般对外提供三样东西:
    • 工具(Tools):让模型”做事”的函数(最常用)
    • 资源(Resources):让模型”读取”的数据
    • 提示词(Prompts):可复用的提示模板
  • 比喻:插到 USB 上的各种设备(键盘、打印机、U 盘)。接口统一,但每个干的活不一样。

记忆钩子:MCP 是”一套”标准;MCP 服务器是”很多个”设备。

顺带记住

  • Claude 里的”连接器(Connectors)“背后就是 MCP。你连 Google Drive、Gmail 时,已经在用 MCP 了。
  • GitHub MCP Registrygithub.com/mcp)= MCP 服务器的”App Store”,用来集中查找和安装。

四、Agent(智能体)—— 重点别和 LLM 搞混

  • 是什么围绕 LLM 搭起来的一整套系统。LLM 是它体内的脑子,但光有脑子不算 Agent
  • Agent = LLM + 工具 + “想-做-看”循环 + 目标管理。

Agent 的核心:那个循环

把对话发给模型 → 模型说”我要调工具 X” → 代码真的执行工具 X → 把结果塞回对话 → 再发给模型 → 直到模型说”搞定了”。

这个 “调用 → 执行 → 喂回 → 再调用”的 while 循环,就是 Agent 的全部精髓。核心代码几十行就能写出来

LLM vs Agent 一眼区分(用”修 bug”举例)

  • 纯 LLM:看一眼代码,输出”你应该这样改”的建议。没法真去改、去跑测试、去验证。
  • Agent:读文件 → 改代码 → 跑测试 → 看到挂了 → 判断 → 再改 → 再跑…… 循环到测试通过为止

记忆钩子:LLM 只”想一次”;Agent 会”想-做-看”地循环干活。


五、AI 技术全景地图(我玩的这套,只是其中一块)

把整个领域想象成一个”栈” + 旁边几个”平行世界”。

        ┌─────────────────────────────┐
  最上层 │  应用 / 编排层               │ ← Agent 循环、MCP、调模型(我现在在学的)
        ├─────────────────────────────┤
  中间层 │  模型本身(训练好的 LLM)    │
        ├─────────────────────────────┤
  最底层 │  造模型:预训练 + 后训练       │ ← 真正的"硬核腹地"
        └─────────────────────────────┘

  旁边平行站着的"另外的世界":
  · 图像生成(扩散模型,架构完全不同)
  · 语音(识别 / 合成)、视频生成
  · 传统 / 非生成式 ML(推荐系统、风控、医疗影像、XGBoost…… 工业界大头)
  · 强化学习 / 机器人 / 具身智能
  · 检索与记忆(embedding 向量、向量库、RAG)
  · 支撑层 MLOps(训练 / 部署 / 评测 / 量化)+ 评估与对齐安全

Agent 循环覆盖的:只是最上层”在文本大模型之上做应用 / 编排”。

它没碰到的:脚下的”模型怎么训出来的”(预训练、SFT、RLHF、推理训练 RL),以及旁边那一整排平行世界。

记忆钩子:我玩的是”用模型”;更底层是”造模型”;旁边还有一堆”别的模型”。

另一根杠杆:微调(Fine-tune)

  • 不只是”prompt 模型”,还可以改变模型本身的行为
  • 跟搭 Agent 是两个完全不同的方向:Agent 是用现成模型,微调是改造模型。

六、权限与安全(重要,别掉以轻心)

一个关键事实(也是安心点)

  • MCP 服务器是借用你的身份和凭证去操作的。
  • 你自己进不去的平台,接 MCP 也进不去 —— 它不会、也无法帮你绕过权限。

真实风险

  1. 权限太大:能”写”就能误删、误改。读取通常安全,写 / 删要小心
  2. 服务器可信度:来路不明的第三方服务器拿到你的令牌可能滥用。
  3. 提示词注入(prompt injection):AI 读到的网页 / issue 里藏了假指令,设计不好的系统可能被骗去执行。危险不一定来自你。

防线 / 实操建议

  • 只想”看 / 分析” → 给只读权限,风险很低。
  • 要”动手改” → 开逐步确认(每次动手前先问你)+ 最小权限令牌(只授权单个仓库 / 只读)。
  • 只用可信来源(官方出品 > 不认识的人写的)。
  • 自己写服务器反而更安全:代码你写的,可以硬性限制”只能查、不能删”。

记忆钩子:先从只读、低风险场景试起,熟了再放权。


七、语言与工具选型(给 Java 开发者)

大局

  • Python:主导”模型 / 研究层”(微调、训练、传统 ML)。做研究绕不开。生态最深(PyTorch、Hugging Face)。
  • TypeScript:在”应用 / 编排层”崛起最快,2025 年成 GitHub 第一语言。适合做 AI Web 产品(前后端 + AI 一套语言)。
  • Java:应用 / 编排层也能完整做(见下)。“造模型”这层基本空白。

Java 能做的(不用换语言就能起步)

  • MCP:官方 io.modelcontextprotocol.sdk:mcp(1.0 正式版,和 Spring AI 合作维护)。
  • Agent 框架:Spring AI 或 LangChain4j。
  • 本地模型:Ollama,Java 端用 Spring AI / LangChain4j 连。

选型决策

你的目标推荐
求稳、复用现有技能Java(Spring AI)先把概念吃透
做 AI Web 产品 / 跟最热应用层生态TypeScript
迟早碰模型本身(微调 / 训练)Python(可等真用到时再学)

记忆钩子:用模型那层啥语言都行;碰模型那层必须 Python。


八、本地跑模型(我的 4070S,12GB 显存)

  • 工具:Ollama(一行命令拉模型)。
  • 能跑:7B~8B 量化模型很舒服,14B 紧一点也行。
  • 选模型:挑**支持工具调用(function calling)**的,如 Qwen2.5-7B、Llama 3.1 8B。
  • 预防针:小模型做 Agent 可靠性不如前沿模型,容易想歪、参数错、循环停不下来。适合学原理 / 玩具项目,别指望生产级稳。

九、给迷茫时的自己

  • “迷茫”是正常的,连业内人都有。领域太快太大,看到地图变大 = 在进步,不是掉队。
  • 没人能”跟上”全部。框架是浪花,会一茬茬换;底层概念几年不变。打好底子 + 会快速学新东西,才是真本事。
  • Java 功底是资产:AI 越能写代码,稀缺的越是”工程判断力” —— 系统设计、排查问题、看方案靠不靠谱。这些学不来。
  • 解药不是”再多看资料”,而是”动手做一个小东西”。亲手把一个最小项目跑通,雾会散一大半。

下一步(低压力)

做一个最小 demo:本地模型(Ollama)+ 手写 Agent 循环 + 一个自定义 MCP 服务器, 场景就用”操作我电脑上的某个文件夹” —— 零权限、零风险, 第一次亲眼看见 LLM + Agent + 工具 怎么咬合转起来。


笔记会随学习更新。先记比喻,再记细节。不急,慢慢来。

Comments

Echo

Jason Walker