返回博客列表

一张图看懂 2026 年 AI 技术栈全景:90% 的人都还没意识到,战争已经从第一层打到了第三层

2026-08-01T12:00:00+08:00
AI 技术栈行业全景HarnessMCPAI 工程化Agent技术地图

一张图看懂 2026 年 AI 技术栈全景:90% 的人都还没意识到,战争已经从第一层打到了第三层

先看这张图。这是我最近见过的,对当前 AI 技术栈最凝练、最准确的总结。

AI
├─ 模型
│  ├─ benchmark(基准评测)
│  └─ FT / LoRA / SFT(模型微调技术)
├─ Agent
│  ├─ harness(执行调度框架)
│  ├─ MCP
│  └─ skill(工具技能)
└─ 工程
   ├─ Eval(效果评估)
   ├─ observability(可观测性)
   ├─ Trace(链路追踪)
   └─ Guardrails(AI安全护栏/约束边界)

短短三行,十几个词,把整个行业现在所有重要的方向,全部概括进去了。

但是这张图真正的价值,不是它说了什么。 而是它没有说出来的那些东西,那些藏在每个词背后的,整个行业正在发生的静悄悄的革命。

今天这篇文章,我就来给你把这张图一层一层拆开了讲。 看完你就会明白: 90% 的人对 AI 行业的认知,还停留在第一层。 而真正的战争,已经打到第三层了。


第一层:模型——战争基本结束,溢价正在消失

最上面这一层,是所有人最熟悉,也是曝光度最高的一层。 也是整个行业里,现在竞争最充分,溢价消失最快的一层。

关于模型层,有几个很少有人愿意明说的真相:

真相 1:基准评测正在变得越来越没有意义

现在的 benchmark 已经卷成了一个笑话。 你涨 0.2 分,我涨 0.3 分,他发一篇论文说自己超过了 GPT-4o。 但是实际用起来,普通开发者根本感觉不到任何区别。 对于 99% 的应用场景来说,今天所有主流模型的能力,都已经过剩了,而且是严重过剩。

你产品做不好,绝对不是因为你的模型比别人差 0.5 分。 你的模型再好 5 分,也不可能给你的产品带来任何用户可感知的提升。

真相 2:微调技术正在快速下沉

两年前,LoRA 还是博士才懂的黑科技。 一年前,微调还是专门的算法工程师的工作。 今天,你只要会用 Python,会点命令行,花几十块钱就能微调一个 70B 的模型。

微调技术还在以非常快的速度变得更简单,更便宜,更自动化。 再过两年,微调会变成和调 SQL 一样的普通开发技能。 不会再有什么"微调工程师"这个岗位了。

真相 3:模型正在变成水电煤

模型层的战争,基本上已经结束了。 全球范围内最后能活下来的通用大模型,不会超过 5 家。 中国范围内,不会超过 3 家。

模型最终会变成和云服务器、带宽、存储一样的大宗商品。 差不多的价格,差不多的质量,你可以随便选,随时可以换。 再也不会有什么"模型壁垒"这种东西了。

所有还把"我们的模型更好"当做核心竞争力的公司,最后都会死得很难看。


第二层:Agent——现在战争的主战场

如果说第一层的战争已经基本结束,那么第二层的战争现在正是打得最激烈的时候。

这也是整个行业现在变化最快,机会最多,也最乱的地方。

Harness:从概念到落地的元年

Harness 这个词,半年前还只是 Google 论文里的一个概念。 半年后的今天,DataFlow 开源了,code-review-graph 火了,已经有至少十几个不同的 Harness 框架在开发了。

Harness 本质上是什么? 是模型的"司机"。 模型再聪明,它自己不知道怎么开车,不知道怎么规划路线,不知道什么时候该加速什么时候该刹车。Harness 知道。

Harness 是 AI 时代的操作系统。 它向下对接各种各样的模型,向上承接各种各样的应用。 它把模型的能力封装成标准化的、可控的、可靠的执行流程。

这个领域现在还非常非常早期,连标准的形态都还没有。 但是所有人都知道,这会是一个千亿美金级别的市场。

MCP:过去十年最重要的协议,没有之一

MCP 协议出来才半年时间,但是它的重要性,怎么强调都不过分。

它做的事情非常简单:定义了一套标准的方式,让 AI 可以调用工具。 但是它带来的影响,会是革命性的。

在 MCP 之前,每个 Agent 框架都有自己的一套工具系统,互相不兼容,生态都是碎片化的。 有了 MCP 之后,工具一次编写,所有 Agent 都可以用。

这是什么概念? 这就是 AI 时代的 TCP/IP 协议。 这是整个 Agent 生态的基础设施。

现在你去看,所有稍微重要一点的 AI 工具,都在做 MCP 集成。 一年之后,还不支持 MCP 的 AI 工具,就会像今天不支持 HTTPS 的网站一样过时。

Skill:万亿级的市场还在沉睡

如果说 MCP 是 TCP/IP,那么 Skill 就是跑在 TCP/IP 上面的 App。

今天的 Skill 生态,大概就处在 2008 年 iPhone App Store 刚出来的那个阶段。 所有人都知道这东西未来会很大,但是还没有人知道它到底会长成什么样子,也还没有杀手级的应用出现。

但是这个方向的潜力是毋庸置疑的。 以后会有几百万、几千万个 Skill,覆盖人类工作的每一个细分领域。 会计有会计的 Skill,律师有律师的 Skill,设计师有设计师的 Skill,程序员有程序员的 Skill。

你不需要自己做一个通用 Agent。 你把你所在行业的知识,封装成一个高质量的 Skill,你就可以躺着赚钱了。

这个万亿级的市场,现在还在沉睡。


第三层:工程——绝大多数人甚至还不知道这一层的存在

这是整张图里最有意思的一层。 也是 90% 的人甚至都没有意识到存在的一层。 也是现在最被低估,但是未来三年最重要的一层。

为什么? 因为 所有的痛苦,都在这一层。

90% 的 AI Demo,永远都只是 Demo,永远上不了线。 为什么? 不是模型不够好,不是 Agent 不够聪明,不是功能不够多。 是因为你没有办法保证它在 10000 次运行里,不会有一次给你捅一个天大的娄子。

是因为你不知道它什么时候会犯错,为什么会犯错,犯了错之后你甚至都没有办法复现。

这就是工程层要解决的问题。

Eval:你怎么知道它做得好不好?

所有用 AI 做过生产系统的人,都会同意:评估是所有问题里最难的那一个。

人类之间的协作,你不需要专门搞一个评估系统。 同事给你提交的代码,你扫一眼就大概知道好不好。 但是 AI 不一样。 你怎么量化地知道,这次版本更新之后,AI 的整体表现是变好了还是变坏了? 你怎么保证你改了提示词的 A 问题,不会让 B 问题变得更严重?

没有好的 Eval 系统,你所有的迭代都是瞎摸。

Observability & Trace:黑盒里面到底发生了什么?

AI 系统和传统软件最大的区别,就是它是个黑盒。 传统软件出了 bug,你可以打日志,可以打断点,可以一步步调试。 AI 出了 bug,你甚至都不知道它为什么会出这个 bug。

可观测性和链路追踪,就是要把这个黑盒变成白盒。 你要能够看到:

  • 它这一次思考,每一步都做了什么
  • 它调用了哪个工具,入参是什么,返回是什么
  • 它是基于哪些信息做出的那个判断
  • 它在哪一步开始走偏了

没有这个,你永远不可能把 AI 系统真正用到生产环境里。

Guardrails:你怎么保证它不闯祸?

最后,也是最重要的:安全护栏。

你怎么保证它不会调用错误的工具? 你怎么保证它不会把用户的敏感数据发到第三方? 你怎么保证它不会生成冒犯性的内容? 你怎么保证它不会执行危险的操作? 你怎么保证,哪怕它出了问题,造成的损失也是可控的?

这些问题,模型解决不了,Agent 框架也解决不了。 只能在工程层解决。


这张图里没有画出来的,但是同样重要的三层

这张图非常棒,但是还有三个非常重要的板块,没有画出来。我来给你补上:

第四层:数据层

这是所有一切的燃料。 合成数据、数据清洗管线、数据标注自动化、数据质量监控。

现在大家都在卷模型,都在卷 Agent。 但是再过一年,所有人都会发现,最后真正的瓶颈,是高质量的数据。 好的数据会变成这个行业最稀缺的资源。

第五层:推理层

推理优化、推理调度、推测解码、KV Cache 优化、多模型负载均衡、边缘推理。

这一层现在正在发生翻天覆地的成本下降。 两年前一万块钱能买的算力,今天可能一千块就够了。 而且这个趋势还在加速。 成本的下降,会打开很多今天根本不可想象的应用场景。

第六层:分发层

最后,你做出来的 AI 能力,怎么送到用户手里? 是做一个独立 App?是做一个 Slack Bot?是集成到现有产品里?还是做成一个 MCP Skill 卖给所有 Agent?

分发层的战争,现在甚至都还没有开始。 但是最终,这会决定谁能拿到用户,谁能赚到钱。


时间线:战争的三个阶段

最后,把这三层合在一起看,你会看到一个非常清晰的时间线:

  • 2022-2024:模型时代 所有人都在卷模型,卷参数,卷 benchmark。 谁的模型好,谁就是老大。

  • 2025-2026:Agent 时代 所有人都在卷 Harness,卷 MCP,卷 Skill 生态。 谁能把模型的能力真正稳定地释放出来,谁就是老大。

  • 2027-2028:工程时代 所有人都会意识到,最终的护城河,既不是模型,也不是 Agent。 是 Eval,是可观测性,是 Trace,是 Guardrails。 是那些看不见摸不着的,扎扎实实的工程能力。 谁能把 AI 系统做得可靠、可控、可维护,谁就是老大。

今天我们正好站在第二个阶段的中间,第三个阶段的入口。 绝大多数人的认知,还停留在第一个阶段。 而最聪明的那些团队,已经开始在第三个阶段布局了。


最后给所有人的四个建议

  1. 别再天天追新模型了 模型之间那点差距,真的不重要。 有那个时间,去花一个星期研究研究 MCP,研究研究 Harness 框架,研究研究怎么做 Eval。 带来的价值会大 10 倍。

  2. 最好的创业机会在下面两层 模型层已经没有什么机会了。 Agent 层机会还有很多,但是已经有很多大公司进场了。 工程层现在几乎还是一片蓝海,几乎没有什么标准化的解决方案,也没有什么绝对的领导者。 这里面会诞生未来的 Datadog,未来的 Splunk,未来的 New Relic。

  3. 现在最值钱的技能,是把东西做上线的能力 现在做 Demo 的人太多了,能把东西做上线,能在生产环境跑起来稳定运行的人太少太少了。 100 个人做 Demo,可能只有 1 个人能真正做上线。 这 1 个人的价值,是剩下 99 个人加起来的 10 倍。

  4. 把你的时间花在不会变的东西上 模型月月都在变,框架周周都在变,今天火的工具,下个月可能就没人提了。 但是 Eval、可观测性、链路追踪、安全护栏,这些东西是底层的、基础的、不会变的。 你今天花时间学的这些知识,五年之后还会有用。


写在最后

我在很多场合都说过一句话: 所有低垂的果实都已经被摘光了。

接下来的竞争,不再是谁能做出一个酷炫的 Demo。 接下来的竞争,是谁能把事情真正做成,做稳定,做到生产环境里去。 接下来的竞争,是工程的竞争,是流程的竞争,是质量的竞争,是可靠性的竞争。

很多人还没有反应过来。 整个游戏的规则,已经彻底变了。

希望这张地图,能帮你在这个混乱的时代,找到你自己的位置。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友