阿里 skill-up:让 Agent Skill 拥有自动进化的能力
阿里 skill-up:让 Agent Skill 拥有自动进化的能力
先收藏,回头一定用得上。
写 Agent Skill 的人越来越多,但有个问题一直没人解决好:怎么知道你的 Skill 到底行不行? 手动跑几个 prompt 看看效果,感觉不错就发布了--这种"差不多就行"的方式,在复杂场景下迟早翻车。
阿里开源的 skill-up 想解决这个问题。它不只是一个评测工具,更狠的是它能自动修复失败的测试用例,然后重新跑,循环迭代直到通过。这个"评测-进化"闭环,是目前 Agent Skill 生态里少见的思路。
本文提纲
- skill-up 是什么
- 核心设计:评测与进化双引擎
- 声明式评测:用 YAML 定义你的测试
- 多引擎支持:不绑定单一 Agent
- skill-upper:让 AI 自动进化你的 Skill
- CI 集成:把评测搬进 GitHub Action
- 上手体验与实测
skill-up 是什么
skill-up 是阿里巴巴开源的 Agent Skill 评测与进化工具,用 Go 编写,Apache 2.0 协议。截至撰文时 GitHub 360 Star。
一句话定位:把 Agent Skill 的评测从"手动凭感觉"变成"声明式可重复",而且能自动迭代改进。
项目仓库地址:https://github.com/alibaba/skill-up
关键数据:
| 项目 | 值 |
|---|---|
| 语言 | Go (>=1.25) |
| License | Apache 2.0 |
| Stars | 360 |
| 创建时间 | 2026-05-09 |
| 支持引擎 | Claude Code, Codex, Qoder CLI, Qwen Code |
核心设计:评测与进化双引擎
skill-up 的设计分两层:
- Evaluation(评测):用声明式 YAML 定义测试用例,在多个 Agent Engine 上运行,用规则、脚本或 Agent 来判定结果,输出结构化报告。
- Evolution(进化):通过对话式交互,
skill-upper读取失败报告,自动修复或扩展测试用例,重新运行 skill-up,持续迭代。
这两层的关系不是松散的--评测产出的报告直接喂给进化层,进化层修改 Skill 或测试用例后再触发评测,形成一个闭环:
写 Skill -> 定义 eval cases -> 运行 skill-up -> 拿到报告
^ |
|________ 修复 Skill / 补充用例 / 重新运行 <____________|官方的 Agent Skills 评测指南 描述了正确的评测循环:写真实用例、带和不带 Skill 各跑一遍、评分、汇总、迭代。skill-up 把这个流程做成了可复用的 CLI 工具。
声明式评测:用 YAML 定义你的测试
skill-up 的评测配置分两个文件:eval.yaml(全局配置)和 cases/*.yaml(具体用例)。
一个 eval.yaml 长这样:
schema_version: v1alpha1
environment:
type: none
workspace_mount: /workspace
skills:
- source: local_path
path: .
engine:
name: claude_code
model:
provider: dashscope
name: qwen3.6-plus
cases:
files:
- evals/cases/detailed-code-review.yaml
defaults:
timeout_seconds: 180
max_turns: 8
parallelism: 1
report:
formats: [json, html]
artifacts:
- transcript配置里声明了运行环境、用哪个 Agent Engine、跑哪些用例、输出什么格式的报告。一目了然,不需要写任何胶水代码。
具体的测试用例文件 cases/detailed-code-review.yaml:
id: detailed-code-review
title: Detailed code review with agent_judge criteria evaluation
description: >
Verify multi-criteria evaluation using agent_judge mode.
tag: functional_test
input:
prompt: |
Review the following code and provide a detailed quality assessment:
func process(u *User) {
fmt.Println(u.Name)
}
context:
files:
main.go: |
package main
type User struct {
Name string
}
func process(u *User) {
fmt.Println(u.Name)
}
expect:
must_contain:
- "Strengths"
- "Issues"
- "Assessment"
judge:
type: agent_judge
model: qwen3.6-plus
criteria:
- "identified the null pointer dereference issue (u may be nil)"
- "provided a specific fix suggestion (nil check)"
- "output contains Strengths/Issues/Assessment structure"
pass_threshold: 0.7这个用例测的是一个代码审查 Skill。它做了几件事:
- 给 Agent 一段有 bug 的 Go 代码(
u可能是 nil) - 定义期望输出必须包含
Strengths、Issues、Assessment三个段落 - 用
agent_judge模式让另一个 LLM 来评判,判定标准包括:是否识别出空指针问题、是否给出修复建议、输出结构是否符合要求 - 通过阈值设为 0.7(3 条标准里至少通过 2 条)
三种评测策略的区别:
| 策略 | 原理 | 适用场景 |
|---|---|---|
rule_based |
关键词匹配、正则、must_contain 等 | 输出格式固定、判定规则明确 |
script |
自定义脚本判定 | 需要复杂逻辑判断 |
agent_judge |
用 LLM 按标准评判 | 输出灵活、需要语义理解 |
agent_judge 是最有意思的一个。你不需要写死判定逻辑,而是给出评判标准(criteria),让另一个 LLM 来打分。这比传统的关键词匹配灵活得多--尤其适合输出格式不固定的 Skill。
多引擎支持:不绑定单一 Agent
skill-up 不绑定某一个 Agent 客户端,内置支持四种引擎:
claude_code- Anthropic 的 Claude Codecodex- OpenAI 的 Codex CLIqodercli- 阿里的 Qoder CLIqwen_code- 通义千问的编程助手
同时支持通过 engine.custom 接入自定义 Agent(基于本地 transport)。这意味着你可以在一个评测套件里,用同一个 Skill 跑不同的 Agent Engine,横向对比谁的效果更好。
对于做 Skill 生态的人来说,这个能力很关键。一个 Skill 在 Claude Code 上跑得好,不代表在 Codex 上也行。多引擎评测让你能及早发现兼容性问题。
skill-upper:让 AI 自动进化你的 Skill
这是 skill-up 最有价值的部分。
skill-upper 是仓库里内置的一个 Agent Skill,它的工作流程是:
- 读取你的
SKILL.md,分析最重要的行为 - 自动创建符合实际的测试用例
- 运行 skill-up,拿到结果报告
- 分析失败原因:是 Skill 的问题,还是测试用例的问题
- 修复 Skill 或修复测试用例,补充回归测试
- 重新运行,循环迭代
你只需要在 Claude Code 或 Codex 里说一句话:
Use skill-upper to evaluate this Skill.
Read SKILL.md, identify its most important behaviors, create realistic eval
cases with appropriate judges, validate the configuration, and run skill-up.
Summarize the results and the highest-impact failures.然后继续对话让它修复和迭代:
Review the latest skill-up results. For each failure, determine whether the
Skill or the eval is wrong. Fix SKILL.md and supporting files, or repair the
eval case and judge as appropriate. Add regression cases for the bugs you
found, rerun skill-up, and continue until the important behaviors pass.安装 skill-upper 很简单:
# Codex 全局安装
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a codex -y
# Claude Code 全局安装
npx skills add https://github.com/alibaba/skill-up/tree/main/skills/skill-upper -g -a claude-code -y这个"评测报告变成修复,修复变成回归用例"的循环,把 Skill 开发从手工调试变成了自动化迭代。每次迭代都让 Skill 和测试套件变得更强。
CI 集成:把评测搬进 GitHub Action
skill-up 提供了官方 GitHub Action,可以在每次 PR 时自动运行 Skill 评测:
# .github/workflows/skill-eval.yml
name: Skill Eval
on:
pull_request:
paths: ['skills/**', 'evals/**', '**/SKILL.md']
jobs:
eval:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- uses: alibaba/skill-up@main
with:
engine: claude_code
api-key: ${{ secrets.ANTHROPIC_API_KEY }}
base-url: https://api.anthropic.com
skill-target: evals/eval.yaml注意几点:
- 只能在 Linux runner 上运行(Docker container action)
- API key 需要存为 repo secret
- 可以在一步内跨多个引擎评测同一个 Skill
- 镜像里预装了 skill-up CLI 和各引擎 CLI,运行就是"拉镜像 + 评测"
- 镜像版本是 pinned 的,不会因为
latest标签导致行为变化
这对团队协作场景很有用。Skill 修改提交 PR 后,CI 自动跑评测,报告里直接显示哪些行为回归了。比口头 review 靠谱得多。
上手体验与实测
如果你不想用 skill-upper 的对话模式,也可以手动安装 CLI:
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bashCLI 命令一览:
| 命令 | 功能 |
|---|---|
skill-up run [path] |
运行评测并生成报告 |
skill-up validate [path] |
验证 eval.yaml 和用例文件 |
skill-up list-cases [path] |
列出配置引用的所有用例 |
skill-up report <result.json> |
从之前的运行结果生成报告 |
skill-up import <evals.json> |
导入 Anthropic 格式的 evals.json |
skill-up debug judge <input.json> |
调试 judge 模块 |
skill-up debug report <input.json> |
调试报告模块 |
skill-up import 支持导入 Anthropic 兼容的 evals.json,如果你已经有现成的评测文件,可以无缝迁移。
报告输出格式包括:grading.json、benchmark.json、benchmark.md、result.json、JUnit XML、HTML。其中 JUnit XML 格式可以直接被 CI 系统解析,HTML 报告方便本地查看。
项目还有完整的文档站:https://alibaba.github.io/skill-up/ ,包括快速入门、编写评测、CLI 参考和用户配置指南,也有中文版。
如果你在写 Agent Skill,不管是给 Claude Code 还是 Codex 用,skill-up 都值得试试。尤其是 agent_judge 模式加 skill-upper 的自动进化循环,能帮你把"感觉还行"变成"数据说话"。
参考文档与链接
- GitHub: alibaba/skill-up - 360 Star,Go 编写,Apache 2.0,Agent Skill 评测与进化工具
- skill-up 用户手册(中文) - 官方文档站,含快速入门、编写评测、CLI 参考
- Getting Started 指南 - 安装和首次运行教程
- Writing Evals 指南 - 如何编写评测用例,39KB 详细文档
- CLI Reference - 完整命令行参考
- Agent Skills 评测指南 - 官方 Skill 评测方法论,skill-up 的设计基础
- 自定义引擎设计文档 - 如何接入自定义 Agent Engine
- DeepWiki: alibaba/skill-up - 自动生成的项目架构 Wiki
试过了?评论区说说你的体验。还没试?收藏起来周末折腾。
作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。
本文首发于 AI人工智能时代,转载请注明出处。