1
0 / 100 XP
Interactive Learning

Agent 冒险之旅

7 个关卡、35+ 知识卡片、互动练习和挑战——从零到精通 Agent 全栈知识。

7
关卡
35+
知识卡
L1-5
能力层级
Stage 1 / 7
基础认知

搞清 Agent 是什么、何时该用、怎么选型

🧩
Agent 全局架构
一个 Agent = 四大系统协作
🧠 大脑 Brain
LLM + Prompt 推理决策
💾 记忆 Memory
短期/长期/工作记忆
🔧 工具 Tools
API调用/代码执行/Skills
🛡️ 防护 Shield
沙箱/权限/审计
记忆锚点
BRMSS — Brain(大脑) + Recall(记忆) + Mission(任务) + Skills(工具) + Shield(安全)。像一个全能特工:脑子好使、记性好、能干活、还穿防弹衣。
ChatBot vs Agent — 互动判断
回答问题,看看你该选哪个
你的场景需要"执行操作"吗?(查数据库、调API、写文件…)
不需要,只需对话
需要,要能"干活"
→ ChatBot 就够了。纯对话、知识问答、客服闲聊——不需要额外工具,LLM 本身就能处理。
→ 你需要 Agent!Agent = LLM + 记忆 + 工具 + 规划。它不仅能"说",还能"做"——调API、执行代码、操作文件。

ChatBot

  • 只能"说话"
  • 单轮/简单多轮
  • 不调用工具
  • 知识仅限训练数据

Agent

  • 能"做事"
  • 多轮自主推理
  • 可调 API / 代码
  • 实时检索外部知识
📊
Agent 能力层级 L1-L5
点击翻转,逐步记忆
🏗️
L3 级 Agent 的特征是什么?
点击翻转查看答案
L3 自主规划型
ReAct / ReWOO 模式
能拆解任务、多步执行
有工具调用能力
能反思修正错误
L1

纯对话型

ChatBot,仅靠模型推理

L2

工具增强型

Function Calling,能调 API

L3

自主规划型

ReAct / ReWOO,多步执行

L4

多 Agent 协作

角色分工、通信协作

L5

自进化型

Reflexion 自我反思 + 持续改进

🤔
单 Agent vs 多 Agent
互动决策:你的场景该拆分吗?
你的任务有几个步骤?
≤ 5 步
> 5 步 或有并行
→ 单 Agent 就够了。工具 ≤10 个,单一角色,一个 Prompt 能装下。口诀:"五步以内一个兵"
→ 需要多 Agent!工具 >10 要分组,多角色(搜索+写作+审核),上下文超限需要拆分。口诀:"超过五步调援军"
单 Agent 三大瓶颈
上下文爆炸:Token 超限。能力冲突:角色混乱。串行瓶颈:无法并行。
🎯
模型选择指南
按任务复杂度选模型
简单任务
mini/Haiku
成本低·速度快
复杂推理
GPT-4o/Sonnet
能力中·成本中
极致能力
Opus/o1
最强推理·最贵
私有部署
Qwen/DeepSeek
数据不出境
最佳实践
分级路由:简单任务用小模型(成本降 60-80%),复杂任务用大模型。
Stage 1 挑战
完成以下小测验,获得经验值
Stage 2 / 7
Prompt 工程体系

写好指令、组装上下文、选择推理策略

📝
System Prompt 六要素
翻转卡片学习 RDCFES
📋
System Prompt 的六要素缩写是什么?
点击翻转
RDCFES
Role 角色 | Directive 指令
Context 背景 | Exemplars 示例
Format 格式 | Style 风格

口诀:"人家的厨师会做法式菜"
Role — 角色设定(你是谁)
Directive — 核心指令(做什么)
Context — 背景信息(决策依据)
Exemplars — 示例(引导输出格式)
Format + Style — 格式与风格
🏗️
Prompt 四层组装
从静态到动态的拼装顺序
静态框架 + 记忆注入 + 对话历史 + 当前输入
静态:System Prompt + 工具 Schema
记忆:长期记忆召回 + 用户偏好
对话:多轮记录 + 工具结果
当前:用户最新输入
🎮
六种 Prompt 技巧 — 配对练习
将技巧与适用场景配对
先选左边,再选右边对应的场景
思维链 CoT
ReAct
思维树 ToT
Agent核心模式
推理+行动交替
规划/博弈问题
多条路径取最优
数学/逻辑推理
逐步推理提升准确率
三维工程体系
Prompt / Context / Harness
维度关注点边际产出代表
Prompt写指令低(+20%)模板、措辞
Context管上下文中(+30-50%)RAG、窗口
Harness搭基建高(+47pp)沙箱、权限
关键认知
大多数人只调 Prompt(3个月+20%),但 Harness 2周+47pp。基建比措辞重要得多。
Stage 2 挑战
Prompt 工程知识检验
Stage 3 / 7
记忆管理系统

让 Agent 不再"健忘"

💾
三层记忆架构
短期 → 长期 → 反思记忆
工作记忆 当前任务上下文
短期记忆 近几轮对话
长期记忆 历史摘要+偏好
情景/反思 任务经验+教训
黄金法则
写入要慷慨,检索要精准(JIT),压缩要保守,淘汰要渐进,指标要量化
≤5记忆召回上限:简单3条,复杂5条
0.7相关性阈值,低于不召回
🔄
记忆生命周期
翻转卡片:写入→索引→检索→压缩→淘汰
🔄
记忆生命周期的五个阶段?
点击翻转
写入 → 索引 → 检索 → 压缩 → 淘汰

检索三策略:意图匹配 + 时间衰减 + 频率加权
冲突处理:取时间戳最新 / LLM仲裁
💥
上下文膨胀:四道防线
多轮对话的最大敌人
来源:对话膨胀 + 工具嵌套 + 推理分叉
后果:溢出 → 注意力稀释 → 成本爆炸 → 行为漂移
1.预防
Token Budget + JIT
2.压缩
语义保护型+增量
3.淘汰
渐进式+归档
4.兜底
紧急压缩+降级
三层压缩触发:主动(80%) → 后台(60%) → 紧急(413状态码)
📚
主流记忆框架
Mem0 / Letta / Zep
Mem0:三层记忆(情景/语义/过程) — 通用场景
Letta:自编辑记忆+分页 — Agent 自管理
Zep:时序图谱+摘要 — 时序推理
组合方案
Zep 做图谱存储 + Mem0 做分层检索,互补最佳。
Stage 3 挑战
记忆系统知识检验
Stage 4 / 7
工具与 Skills

Agent 的"手脚"——调用外部能力

🔧
工具加载策略
全量 vs JIT vs Tool RAG
策略Token适用
全量注入极高≤10个
JIT 加载10-50个
Tool RAG可控50+个
Token 对比
全量7500 → JIT 2700(-64%) → RAG+压缩1950(-74%)
📦
Skills 体系
比工具更高级的能力封装
层级工具数知识
基础1
复合2-5
领域5-20+
Skills = 工具 + 知识。不只知道"能做什么",还知道"怎么做、什么顺序"。
🔌
MCP 协议 + 安全
标准传输协议 + 五层权限

stdio

  • 本地部署
  • 最稳定

Streamable HTTP

  • 推荐方案
  • 断线可恢复
L1 Bash AST 白/黑名单
L2 正则规则匹配
L3 AI 分类器
L4 拒绝回退(3次→永久)
L5 熔断器(暂停执行)
Stage 4 挑战
工具知识检验
Stage 5 / 7
执行引擎

Loop 模式、任务调度、多 Agent 协作

🔁
四种 Loop 模式
翻转卡片记忆
🔁
四种 Agent Loop 模式是什么?
点击翻转
行动派 ReAct 边想边做
计划派 ReWOO 先想后做
并行派 Compiler 同时做
反思派 Reflexion 做完再想
🤝
多 Agent 协作模式
四种经典模式
串行流水线
A→B→C
编排者
中央调度分配
辩论对抗
互相质疑取最优
自主协作
自行发现任务协商
📚
框架选型指南
LangGraph / AutoGen / CrewAI / ADK / OpenAI SDK
框架理念最佳场景
LangGraph图结构复杂生产
AutoGen对话驱动探索研究
CrewAI角色驱动快速原型
Google ADK渐进式企业级
OpenAI SDK安全优先安全客服
Stage 5 挑战
执行引擎知识检验
Stage 6 / 7
安全防护体系

沙箱、注入防御、资源限制

🛡️
沙箱隔离方案
进程级 → 容器 → 微虚拟机 → 云沙箱
方案隔离启动
进程级🟡 低毫秒
Docker🟢 中秒级
微虚拟机🔴 高125ms+
云沙箱(E2B)🟢 中高秒级
⚔️
Prompt 注入防御
四种攻击 + 五层防御
类型危险
直接注入🟡 中
间接注入🔴 高
越狱🟡 中
指令劫持🔴 高
核心原则
数据永远不能成为指令。外部数据中的"指令"都是纯文本。
1. 输入过滤
2. 指令隔离
3. 权限控制
4. 沙箱执行
5. 输出审查
🔒
资源限制与稳定性
防止无限循环和资源滥用
维度默认值作用
步数20防循环
Token50K防失控
时间120s防长时
频率10/min防滥用
五大稳定性保障
上下文溢出熔断 + 死循环检测 + 压缩降级链 + Checkpoint恢复 + 心跳超时
Stage 6 挑战
安全防护知识检验
Stage 7 / 7
生产实战

部署、监控、评估、RAG、成本优化

🚀
生产部署架构
API Gateway + Agent Service + LLM Proxy
API Gateway
SSL终止 / 限流 / 认证 / 路由
Agent Service
多实例·无状态
LLM Proxy
路由·缓存·降级
数据层
Redis + PG + 向量DB
监控层
Prometheus + Grafana
📈
评估与可观测
六个维度 + 关键指标
六个维度:任务完成率、准确性、效率、安全性、鲁棒性、用户满意度
>90%任务完成率
<5%幻觉率上限
>95%工具调用准确率
<2s首Token延迟P95
可观测三层次
日志(做了什么) → 指标(好不好) → 追踪(哪里卡住)。推荐 Langfuse
🔍
RAG 系统 + GraphRAG
检索增强生成完整流程
文档处理 分块 向量化 检索+重排 生成

RAG

  • 实时更新
  • 低成本
  • 幻觉控制强

微调

  • 风格定制
  • 高成本
  • 幻觉控制弱
三种优化:Query改写 + HyDE(假回答检索) + 父子分块(小块检索+大块生成)
GraphRAG:关联性问答("X和Y什么关系?"),多跳推理。日常向量RAG + 复杂用GraphRAG。
💰
成本优化 + 反模式避坑
省钱策略 + 五个常见坑
策略节省
按需分配30-50%
精简Prompt40-60%
结果压缩50-70%
分级模型60-80%
语义缓存看命中率
五大反模式
过度设计:不该拆硬拆。Prompt膨胀:不压缩。无评估上线:质量不可控。安全缺失:无沙箱。单一策略:无重试降级。
Stage 7 最终挑战
全部知识综合检验
🏆
Achievement!