为什么需要评测技能?
一个技能可能让 AI 的输出结构更清晰,也可能只是多绕了一圈,结果和直接问 AI 差不多。更糟的情况是,技能反而限制了模型本身的能力,输出质量不升反降。 没有评测,这些都只能靠感觉。42eval 把感觉变成数据。如何启用
- 命令行工具
42plugin eval— 适合批量操作和自动化 - 交互式技能
/42plugin-eval— 在 Claude Code 中使用,AI 引导你完成评测
核心方法:衡量技能的增量贡献
42eval 不问「输出好不好」,而是问「相比不用技能,输出多了什么」。 用同一道题考两遍——一遍让 AI「带着技能」答题,一遍让 AI「裸考」。然后对比两份答卷,逐条检查断言是通过还是失败。差值就是技能的真实贡献。断言的四种分类
其中 differential(差异化) 断言是重点——它检查的是「只有用了技能才会出现的东西」。
技能矩阵:四种技能类型
42eval 用一个 2×2 矩阵刻画技能的价值来源:AI 模型自身能力和技能编码的人类经验质量。
不同象限的技能,价值来源和评测策略不同。
42plugin eval classify 会自动分析并推荐对应的评测策略。
断言健康度:评测你的评测
评测完成后,每条断言会被标记健康状态:两种使用方式
方式一:在 Claude Code 中交互式评测
适合第一次使用或快速评测一个技能。方式二:命令行独立运行
适合批量评测或 CI 集成。读懂评测结果
关键指标是 delta(增量)——用了技能后,断言通过率比不用技能高出多少。迭代改进
评测不是终点,而是改进的起点:命令速查
所有命令都支持
--json 输出。
42eval 需要 42plugin CLI 0.3.9 或更高版本。运行
42plugin upgrade 升级到最新版。相关功能
创建技能
使用元插件快速创作技能
多代理创作
多代理协作创建高质量技能