李博杰开源《深入理解 AI Agent》:10 章正文 + 60 个可运行 demo,可能是目前最系统、最工程化的 Agent 实战教材
李博杰开源《深入理解 AI Agent》:10 章正文 + 60 个可运行 demo,可能是目前最系统、最工程化的 Agent 实战教材
如果你想真正理解 AI Agent,而不是停留在自媒体的概念 hype 上。 如果你想亲手把 Agent 跑起来,而不是只会对着别人的 demo 喊牛逼。 如果你想学习那些生产级 Agent 的工程细节,而不是那些"三行代码做一个 Agent"的玩具教程。
那么今天这个项目,你绝对不能错过。
它就是李博杰刚刚开源的: 《深入理解 AI Agent:设计原理与工程实践》
GitHub 地址:https://github.com/bojieli/ai-agent-book
这不是一本只讲概念的书。这是一本"干"到骨子里的实战教材。 全书 10 章正文,每一章都配有完整的、可以直接跑起来的 demo 代码。 加起来一共 60 多个可运行的实验项目。
而且全书完全开源,免费下载,没有任何门槛。 中文写完了,社区还贡献了英文、越南语、泰米尔语的翻译。
这篇文章,我来给你好好介绍一下这本神书到底好在哪里。
先搞清楚:这本书的定位是什么?
现在讲 AI Agent 的书和文章很多。但是绝大多数都可以归为两类:
第一类是科普类:什么是 Agent?Agent 有哪几个组成部分?ReAct 是什么?给你画个圈圈图图,讲一堆概念。看完了你还是不知道怎么写一行 Agent 代码。
第二类是玩具类:三行代码用 LangChain 做一个 Agent,连个网搜个东西。告诉你这就是 Agent 了。真用到生产环境,一百个坑等着你踩,没有人会告诉你怎么解决。
李博杰这本书,走的是第三条路: 从第一性原理出发,系统地、完整地、工程化地讲清楚 Agent 技术的每一个层面。
全书围绕一个核心公式展开:
Agent = LLM + 上下文 + 工具
就这么简单。 但是围绕这个公式,这本书把每一个字母都给你掰开了揉碎了讲,而且每个知识点都配有可以跑的代码。
这不是一本让你"读"的书。 这是一本让你"做"的书。
10 章内容概览:从基础到前沿,全覆盖
全书一共 10 章,从最基础的概念,到最前沿的研究方向,形成一个完整的知识体系。
让我一章一章给你介绍:
第 1 章:Agent 基础知识
这一章帮你建立整个知识体系的框架。
从"模型即 Agent"的新范式出发,建立 Agent = LLM + 上下文 + 工具 的核心公式。 然后直接点题:Harness 工程——模型之外的一切工程能力,才是真正的竞争力所在。
配套的 demo:
- ✅ learning-from-experience:对比传统强化学习和 LLM 上下文学习,展示 LLM 如何以 250-400 倍的样本效率超越传统 RL
- ✅ web-search-agent:基于 Kimi K2 的原生搜索 Agent
- ✅ search-codegen:综合利用网络搜索和代码执行的 Agent
- ✅ context:上下文消融研究,系统性展示各个组件的重要性
光是第一章的这四个 demo,就已经超过了市面上绝大多数的 Agent 教程。
第 2 章:上下文工程
这是整本书最重要的一章。
上下文决定 Agent 的能力上限。
很多人觉得 Agent 不行是模型不行,换个更好的模型就行了。 但是实际上,90% 的情况下,是你的上下文管理做得烂。
这一章深入讲解:
- 大模型 API 的上下文结构
- KV Cache 友好设计
- 提示工程与动态提示词
- Agent Skills 与渐进式披露
- 状态栏元信息
- 上下文压缩策略
配套的 demo 多达 10 个:
- ✅ local_llm_serving:本地 LLM 部署,展示 0.6B 的小模型也能通过良好设计实现出色的工具调用
- ✅ attention_visualization:注意力机制可视化,看模型到底在关注什么
- ✅ kv-cache:不同上下文管理模式对 KV Cache 的影响
- ✅ context-compression:多种上下文压缩策略对比
- ✅ prompt-engineering:提示工程消融研究,量化不同因素的影响
- ✅ prompt-injection:3 种攻击 × 4 种防御的对照实验,展示提示注入攻防
- ✅ agent-skills-ppt:Agent Skills 渐进式披露的完整实现,真的能生成 PPT 文件
这一章看完,你对上下文的理解会超越 99% 的开发者。
第 3 章:用户记忆和知识库
让 Agent 跨会话记住用户,接入外部知识。
这一章覆盖了从最基础的 RAG,到最前沿的检索技术:
- 用户记忆系统的设计
- 基础 RAG 管道
- 稠密向量检索 vs 稀疏检索
- 混合检索与神经重排序
- RAPTOR 递归抽象树
- GraphRAG 知识图谱
- Agentic RAG
- 上下文感知检索
配套的 demo 有 12 个。 而且非常贴心的是,很多技术都同时提供了多种实现方案,方便你横向对比。
比如 mem0 和 Memobase 两个开源记忆框架,作者都实现了一版,让你自己对比效果。
第 4 章:工具
工具是 Agent 的双手。
这一章系统地讲解了工具的设计原理、MCP 协议、工具选择的挑战,以及三大类工具:
- 感知工具:看、听、读、搜
- 执行工具:写、改、跑、操作
- 协作工具:人、通知、定时
配套的 demo:
- ✅ perception-tools:完整的感知工具 MCP 服务器,全部基于免费开放 API
- ✅ execution-tools:带安全机制的执行工具集,有 LLM 二次审批防止危险操作
- ✅ collaboration-tools:协作工具 MCP 服务器,含浏览器自动化、HITL、多渠道通知
- ✅ agent-with-event-trigger:基于 FastAPI 的事件驱动 Agent,集成所有工具
- ✅ async-agent:带并行执行和打断能力的异步 Agent 框架
这一章讲完,你完全可以基于它做一个生产级的 Agent 平台。
第 5 章:Coding Agent 与代码生成
这是我个人最喜欢的一章,也是最硬核的一章。
代码是"能创造新工具的工具",是通用 Agent 的元能力。
这一章以生产级 Coding Agent 为例,展示了这一最强通用工具的完整实现。而且作者还把代码写得非常优雅,纯 Python 实现,没有乱七八糟的依赖。
配套的 demo 多达 12 个,每个都非常精彩:
- ✅ coding-agent:生产级 Coding Agent,17 个完整实现的工具,纯 Python
- ✅ code-for-math:用代码辅助提升数学解题能力,对比纯思维链
- ✅ code-for-logic:把逻辑谜题转化为约束满足问题,用代码求解
- ✅ paper-to-ppt:论文自动生成 PPT,提议者-审核者双 Agent 架构
- ✅ paper-to-video:论文自动生成讲解视频
- ✅ adaptive-log-parser:能自我进化的日志解析系统,遇到新格式自动生成解析代码
- ✅ log-diagnosis:生产日志智能诊断,自动定位根因、生成回归测试
- ✅ dynamic-form:动态表单意图澄清系统,遇到信息不完整自动生成表单
- ✅ erp-agent:自然语言转 SQL,artifact 模式让几万行结果秒回
每一个 demo 单独拿出来,都能当一个创业项目的 MVP。
第 6 章到第 10 章:高级主题
后面五章就进入了更前沿、更深度的领域:
第 6 章:Agent 的评估
- 怎么把 Agent 的表现变成可比较的信号
- 评估环境、数据集设计、指标体系
- 统计显著性、可观测性、评估驱动选型
- 生产级内部评估与仿真环境
第 7 章:模型后训练
- 预训练、SFT、RL 三阶段全景
- 何时选 SFT,何时选 RL
- RLHF、算法比较、数据与环境
- 让模型学会工具调用的前沿探索
第 8 章:Agent 的自我进化
- 不改权重也能成长
- 三种学习范式
- 从经验中学习、主动工具发现
- 从工具使用者到工具创造者
第 9 章:多模态与实时交互
- 语音三范式
- 流式语音感知与合成
- Computer Use
- 机器人操作
第 10 章:多 Agent 协作
- 多 Agent 分类框架
- 何时真正优于单 Agent
- 共享与不共享上下文的协作
- 失败模式
- 涌现的"Agent 社会"
这本书最难得的三个特点
市面上讲 Agent 的材料这么多,为什么我独独推荐这一本? 因为它有三个非常非常难得的特点。
特点 1:诚实,不吹牛逼
很多讲 AI 的书和文章,最喜欢夸大其词。 "颠覆"、"革命"、"划时代"、"未来已来"……口号喊得震天响。
这本书不一样。它非常非常诚实。 一个技术,它的优势是什么,局限是什么,在什么场景下有用,在什么场景下是坑,作者都明明白白告诉你。 不会说这个技术天下第一,也不会说那个技术一无是处。
比如讲上下文压缩,它会告诉你压缩策略在提升效率的同时,也会损失信息,也会引入新的错误。 比如讲多 Agent,它会明确告诉你,大多数场景下多 Agent 并不比单 Agent 好,大多数时候只是徒增复杂度。
这种诚实的态度,在 AI 这个领域,太稀缺了。
特点 2:所有东西都有代码,所有代码都能跑
很多书的做法是:我给你讲一个概念,然后告诉你"有兴趣的读者可以自己实现一下"。
这本书的做法是:我给你讲一个概念,然后这里是完整的、可以直接跑的、我已经帮你踩过所有坑的实现代码。你现在就可以跑起来看效果。
60 多个 demo,几乎覆盖了书中提到的所有知识点。 而且绝大多数都是 ✅ 可独立运行的,配置个 API Key 就能跑。 少数需要外部依赖的,作者也都写了详细的复现指南。
这才是真正的开源精神。 不是开源一个 README,是开源所有的东西。
特点 3:对比思维,用实验说话
这本书里到处都是对照实验。
讲记忆系统?mem0 实现一版,Memobase 实现一版,你自己对比效果。 讲检索?稠密检索实现一版,稀疏检索实现一版,混合检索再实现一版,对比效果。 讲代码辅助?纯思维链做一遍,代码辅助做一遍,对比准确率。 讲提示注入?3 种攻击 × 4 种防御,12 组对照实验,给你看数据。
作者从来不会说"某某技术最好"。 他会说"我们做了这么几组实验,数据显示在 A 场景下 X 好,在 B 场景下 Y 好,各有什么 trade-off,你自己选。"
这才是做工程的态度。
怎么用好这本书?
最后给大家几个建议,告诉你怎么把这本书的价值发挥到最大。
建议 1:不要光读,要跑
读这本书最好的方式,不是坐在那里从头到尾读一遍。 是打开你的电脑,一边读,一边把每个 demo 都跑一遍。
跑起来之后,改一改参数,改一改提示词,看看会有什么变化。 故意搞点破坏,看看它会怎么出错。 把你自己的想法加进去,看看能不能做得更好。
这才是真正的学习。
建议 2:不要纠结用什么模型
很多人一上来就问:这个 demo 支持某某模型吗?我没有 Claude API Key 怎么办?
不要纠结这个。 这本书讲的是工程方法,不是某个特定模型的使用指南。 你用 Claude 可以,用 GPT-4o 可以,用 Qwen 可以,用 DeepSeek 也可以。 原理是一样的,工程方法是一样的。
模型会换,会过时,会越来越便宜,越来越好用。 但是这些工程知识、这些设计原则、这些踩过的坑,是永远不会过时的。
建议 3:带着问题读,带着项目读
如果你正好有一个要做的 Agent 项目,那你读这本书的收获会翻倍。 读到某一章的时候,停下来想想,这个知识点能不能用到我的项目里? 这个 demo,能不能改成我需要的样子?
带着问题读,带着需求读,你的理解会深刻得多。
写在最后
AI Agent 这个领域,现在还是非常早期的阶段。 每天都有新的概念冒出来,每天都有新的 hype,每天都有新的噪音。 很多人在这种混乱中,反而不知道该学什么了。
李博杰这本书最大的价值,就是它帮你把所有的噪音都过滤掉了。 它给了你一个清晰的、稳定的、可以依赖的知识框架。 给了你一个可以站上去的肩膀。
你不需要再在成千上万的博客和论文里迷失了。 你不需要再去追那些三天就过时的热点了。 你拿着这本书,一章一章读,一个 demo 一个 demo 跑。 等你把这本书读完,你对 Agent 的理解,就会超过这个行业里 95% 的人。
这就是一本好书的价值。
最后再放一遍地址,赶紧去 star,赶紧去读: 👉 https://github.com/bojieli/ai-agent-book
作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。
本文首发于 AI人工智能时代,转载请注明出处。