返回博客列表

OpenAI 亲自下场做代码安全了:Codex Security 横空出世,一行命令扫全仓漏洞,还能自动修复并验证

2026-08-11T12:00:00+08:00
Codex SecurityOpenAI代码安全安全扫描CI/CD漏洞检测自动修复

OpenAI 亲自下场做代码安全了:Codex Security 横空出世,一行命令扫全仓漏洞,还能自动修复并验证

代码安全这个行业,昨天迎来了一个可能会彻底改变整个格局的玩家。

OpenAI 正式发布了 Codex Security

GitHub 地址:https://github.com/openai/codex-security 官方文档:https://learn.chatgpt.com/docs/security/cli

一句话定位:一行命令扫全仓漏洞的 CI 安全巡逻。

这不是又一个第三方的、基于正则的、误报率高到离谱的安全扫描器。 这是 OpenAI 官方出品的、原生基于大模型的、完整的端到端代码安全解决方案。

它不只是帮你找出漏洞。 它还会帮你写出修复代码。 它还会自己跑测试,验证这个修复是不是真的解决了问题,有没有引入新的问题。 它还会直接接入你的 CI 流水线,在每次提交的时候自动运行,再也不用人工兜底发版安全。

这件事的影响,将会比绝大多数人想象的要深远得多。


先看它到底能做什么

在深入讲之前,我们先看一下最基本的使用。

真的简单到离谱:

# 安装
npm install @openai/codex-security

# 登录
npx @openai/codex-security login

# 扫描当前目录的整个仓库
npx @openai/codex-security scan .

# 用最强的模型,最高的扫描力度
npx @openai/codex-security scan . --model gpt-5.6-terra --effort high

就这么三行命令。 然后它就会把你整个仓库扫一遍,把所有的安全漏洞列出来,每个漏洞都有:

  • 风险等级(严重/高/中/低)
  • 漏洞的准确位置和代码片段
  • 详细的漏洞原理说明
  • 完整的修复代码建议
  • 修复之后的验证结果

就这么简单。

传统的安全扫描工具,你可能需要花半天时间配置,花一天时间调规则,然后出来几百个告警,90% 都是误报,然后你还要一个一个人工去看。

现在,一行命令,五分钟,给你一个干净、准确、可以直接用的结果。

这就是差距。


和传统安全扫描工具的三个本质区别

很多人看了可能会说:这不就是又一个代码扫描工具吗?现在已经有那么多了,有什么区别?

区别大了。 从根上就不一样。

区别 1:它懂代码在做什么,而不只是找特征字符串

传统的静态代码扫描工具(SAST),本质上都是高级的 grep。 它们有一个巨大的规则库,每个规则对应一个漏洞的特征字符串或者代码模式。 只要匹配上了,就告警。

这种方式的问题是什么?

  • 误报率极高,经常能到 80% 甚至 90%
  • 只能发现已知的、有明确特征的漏洞
  • 完全发现不了业务逻辑层面的漏洞
  • 上下文稍微复杂一点就瞎了

但是 Codex Security 完全不一样。 它是真的理解代码在做什么。 它会读整个文件,理解整个函数的逻辑,理解整个调用链,理解上下文。 它能发现那种根本没有明确特征的、只有人才能看出来的逻辑漏洞。

举个例子: 一个权限检查的函数,在 99% 的地方都调用了,但是唯独某一个边缘 case 漏掉了。 传统扫描工具根本发现不了,因为那个函数本身是存在的,调用模式也都对。 但是 Codex Security 能看出来:哦,这里有个路径,没有走权限检查。

这就是本质的区别。

区别 2:它不只是发现问题,它还会解决问题,还会自己验证

绝大多数安全扫描工具,到发现问题就结束了。 它把漏洞抛给你,剩下的就是你的事了。 你得自己理解这个漏洞,自己想怎么修,自己改代码,自己测试,自己验证修复是不是真的有效。

但是 Codex Security 会把整个链条全部做完:

  1. 发现漏洞:找到问题在哪里,是什么问题
  2. 生成修复:写出完整的修复代码
  3. 验证修复:它会自己跑相关的测试,验证这个修复是不是真的解决了问题,有没有引入新的 bug,有没有破坏原来的功能
  4. 给出报告:告诉你这个修复有没有通过验证,有多大把握是安全的

这才是真正的端到端。 安全工程师以前 90% 的工作,它直接帮你做完了。

区别 3:变更级扫描,而不是全量扫描

这是我最喜欢的一个特性。

传统的安全扫描,要么是全量扫描,扫一次几个小时,只能每天晚上跑一次。 要么是增量扫描,但是很蠢,只要文件变了一个字符就整个文件重新扫一遍。

但是 Codex Security 是真正的变更级扫描。 它知道你这次提交到底改了什么,到底哪几行代码变了。 它只会针对变化的部分,以及和变化部分相关的调用链,做深入的扫描。

原来全量扫描要几个小时,现在可能几分钟就跑完了。 而且最棒的是: 你可以把它直接接在 PR 上,每次提交自动跑。

提交代码之后,五分钟之内,它就会告诉你: 你这次提交的代码,有没有引入新的安全漏洞。 如果有,问题在哪里,怎么修。

这才是真正的「左移」。 安全不再是发版前的一个关卡,不再是一个季度一次的审计。 安全变成了开发流程的一部分,每次提交,自动就做了。


三个最核心的特性详解

我们来深入看一下它最核心的三个特性。

特性 1:变更级扫描,专为 CI 设计

这是整个产品的设计核心。 Codex Security 从第一天开始,就是为了在 CI 里面运行而设计的。

它的 CI 集成简单到离谱: 你只需要在你的 CI 配置里加两行,设置好 OPENAI_API_KEY 环境变量,就完事了。

# 在 CI 里直接运行,不需要登录
npx @openai/codex-security scan .

没有复杂的配置,没有要维护的规则库,没有要管理的服务端。 就一行命令。

而且它真的足够快。 一次 PR 级别的扫描,通常几分钟就跑完了,完全不会拖慢你的发布节奏。

更棒的是它还有扫描对比功能:

npx @openai/codex-security scans compare BEFORE_SCAN_ID AFTER_SCAN_ID

它会自动对比两次扫描的结果,告诉你:

  • 哪些漏洞是这次新增的
  • 哪些旧的漏洞被修复了
  • 哪些漏洞又重新出现了
  • 哪些漏洞还在,没有变化

再也不用人工去对比这次扫描和上次扫描有什么区别了。

特性 2:修复验证,这才是真正的杀手级功能

我认为这才是真正把所有其他安全扫描工具远远甩在后面的一个功能。

几乎所有的 AI 代码工具,现在都能给你生成修复建议。 但是问题是:这个修复建议对不对?会不会引入新的 bug?会不会把原来的功能搞坏?

没有人知道。 最后还是要人工去看,人工去改,人工去测试。

但是 Codex Security 不一样。 它生成完修复代码之后,它会自己去验证这个修复是不是真的有效。

它会:

  1. 把修复代码应用到本地
  2. 跑相关的单元测试和集成测试
  3. 看测试有没有通过
  4. 看漏洞是不是真的消失了
  5. 看有没有引入新的问题
  6. 最后给你一个明确的结论:这个修复是安全的,还是有风险的

而且它还会把整个验证过程的日志都给你看。 你可以清清楚楚地看到它做了什么,结果是什么。

这个功能的价值,怎么强调都不为过。 它把安全工程师的工作量,直接减少了 80% 以上。

特性 3:原生 TypeScript SDK,可以嵌入到任何地方

它不只是一个 CLI 工具。 它还有一个完整的、功能对等的 TypeScript SDK。

你可以非常容易地把它嵌入到你自己的工具、自己的平台、自己的工作流里面。

import { CodexSecurity } from "@openai/codex-security";

const security = new CodexSecurity();
const result = await security.run(".");

console.log(result.reportPath);
await security.close();

这个想象空间就太大了:

  • 你可以把它嵌入到你自己的内部开发平台
  • 你可以把它嵌入到你的代码评审机器人
  • 你可以用它做批量的、跨所有仓库的安全审计
  • 你可以基于它做你自己的定制化安全工作流

而且它还提供了官方的 Docker 镜像和 Docker Compose 配置,支持大规模的、非交互式的、可恢复的批量扫描。 可以一次扫几百上千个仓库。

对于安全团队来说,这简直就是梦中情工具。


技术栈和要求

它的技术栈非常干净:

  • Node.js 22.13.0+ 或者 24.x / 26.x
  • Python 3.10+
  • 底层用的是 GPT-5.6 Terra 模型(也可以选别的模型)
  • 支持用 API Key,也支持用 ChatGPT 账号登录

没有乱七八糟的依赖,不用部署什么复杂的服务。 就是一个 npm 包,装完就能用。

对于 CI 环境来说,这个要求非常低,基本上所有主流的 CI 平台都支持。


这个工具出来之后,对整个行业的影响

Codex Security 的发布,我认为会彻底改变代码安全这个行业。 很多现有的商业模式,将会被直接颠覆。

影响 1:传统 SAST 工具的日子会越来越难过

传统的静态代码扫描工具,每年几十万甚至上百万的 License 费用,还要专门雇几个人来维护规则,维护误报黑名单。 现在,一年的钱,够你跑几百万次 Codex Security 扫描。 而且效果还好得多,误报率低得多,功能还强得多。

除了那种有非常严格的合规要求,必须用某个特定工具的场景之外。 绝大多数公司,没有任何理由再用传统的 SAST 工具了。

影响 2:安全工程师的工作内容将会彻底改变

以前安全工程师的日常是什么样的?

  • 扫出几百个漏洞
  • 一个一个人工审核,剔除误报
  • 把真的漏洞提给开发团队
  • 催开发团队修复
  • 修复完了再人工验证
  • 循环往复

这些工作,90% 都会被 Codex Security 自动化掉。

未来的安全工程师,不需要再做这些重复性的劳动了。 他们的工作将会变成:

  • 设计安全架构和安全规范
  • 做深度的威胁建模和风险评估
  • 处理那些最复杂的、AI 也搞不定的高级安全问题
  • 建设和优化整个公司的安全体系

从体力劳动,变成真正的脑力劳动。

影响 3:安全真正的左移,变成开发流程的原生部分

说了这么多年的安全左移,一直都是雷声大雨点小。 为什么? 因为太麻烦了,太慢了,太影响开发效率了。 开发人员不愿意等,安全团队也没有足够的人力去跟每一个 PR。

但是现在不一样了。 一行命令,五分钟,自动出结果,自动给修复建议,自动验证。 再也没有理由不在每个 PR 上跑安全扫描了。

安全将会真正地变成开发流程的原生部分。 就像现在跑单元测试一样自然,一样普遍。


给不同角色的建议

最后,针对不同的人,给大家几个非常实在的建议。

如果你是开发人员

今天就把它装上,在你提交 PR 之前,自己先跑一遍。 花五分钟,把能发现的问题在本地就解决掉。 不要等到安全团队来找你,不要等到发版前才发现有漏洞要改。 早发现早解决,省下来的都是你自己的时间。

如果你是安全工程师

不要抵触它,不要觉得它会抢你的工作。 恰恰相反,它会把你从那些无聊的、重复性的体力劳动里解放出来。 让你有时间去做真正有价值的、真正能提升公司安全水位的工作。 去研究更复杂的攻击,去设计更好的安全架构,去做更深度的威胁建模。 你的价值只会更高,不会更低。

如果你是技术负责人

立刻评估这个工具,然后尽快在你们公司的所有仓库全面推广。 这是目前我能想到的,投入产出比最高的安全投入。 花一点 API 的钱,换来整个公司代码安全水位的大幅提升,换来安全工程师大量的时间节省。 这笔账怎么算都划算。

如果你是做安全工具的创业者

认真研究一下这个工具。 想想你的差异化在哪里,想想你还有什么价值是这个工具提供不了的。 如果你的核心价值就是"用 AI 找漏洞",那你现在需要认真考虑一下转型了。 这个赛道以后就是大厂的游戏了。


现在还有什么不足

当然,现在的 Codex Security 还不是完美的,还有很多可以改进的地方。

不足 1:目前主要支持的语言还不够多

目前对 TypeScript/JavaScript、Python 支持最好。 其他语言比如 Java、Go、Rust 等等,支持程度还比较一般。 不过这只是时间问题,以后肯定会越来越好。

不足 2:复杂的、跨多个文件的漏洞还不容易发现

如果一个漏洞的调用链跨了七八个文件,分散在十几个函数里。 现在的版本还是有可能会漏掉。 当然,这种漏洞,人类安全工程师也很容易漏掉。

不足 3:企业级功能还比较少

现在还没有什么多租户、团队管理、统一仪表盘、合规报表之类的企业级功能。 对于大型企业来说,可能还需要等一等。 但是我相信这些功能很快就会加上。


写在最后

很多人经常问我:AI 到底什么时候才能真正在企业里落地,真正创造价值,而不是写个文案画个图?

我的答案是:现在。 就在此时此刻。

Codex Security 就是这样一个产品。 它不是一个玩具,不是一个 Demo,不是一个概念验证。 它是一个真正能用的、真正能解决真实世界问题的、真正能帮公司省钱、省时间、降低风险的生产级工具。

而且更棒的是,它足够简单,足够便宜,足够容易集成。 任何公司,任何团队,今天就能用上,今天就能看到效果。

这才是 AI 真正应该有的样子。 不是替代人,而是把人从那些无聊、重复、痛苦的劳动里解放出来。 让人去做那些真正需要智慧、需要创造力、需要判断力的工作。

我非常期待看到,在这个工具的帮助下,整个行业的代码安全水位,能向前迈进一大步。

而我们每一个人,都是这个历史进程的见证者。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友