- Published on
claude plugin eval:用数字证明插件价值的时代
假设你开发了一个插件。但这个插件真的让Claude运行得更好吗?不是凭直觉,而是用数字来验证。 现在这成为可能了。
2026年9月11日,Anthropic在Claude Code v2.1.269中发布了claude plugin eval命令——一个专门测量插件实际效果的eval工具。
核心理念:"有插件 vs 无插件"
Δ(Delta)的含义
claude plugin eval的设计理念很简单。每个测试用例运行两次:
- with-arm:插件已加载的状态
- without-arm:没有插件的基本状态
两个结果的差值,**Δ(Delta)**就是插件的实际贡献值。分数提升说明插件有贡献,下降说明反而产生了干扰。
过去只能依赖"感觉还不错"的直觉。现在可以说Δ = +0.23了。
6种评分器类型
Anthropic提供6种评分器,4种免费,2种付费(基于LLM调用)。
免费评分器(基于转录和文件)
| 评分器 | 测量对象 |
|---|---|
regex | 输出文本中是否存在某个模式 |
tool_used | 特定工具是否被调用 |
tool_order | 工具是否按规定顺序调用 |
file_exists | 特定文件是否被创建 |
付费评分器(LLM调用)
llm:LLM读取输出并评估质量baseline:直接比较with-arm和without-arm的输出,选出更好的一个
集成到CI流水线
核心参数
claude plugin eval --threshold 0.8 --max-cost-usd 20
--threshold 0.8:总分低于0.8则构建失败--max-cost-usd 20:LLM评分器费用超过20美元时停止
将这两个参数添加到GitHub Actions或CI流水线中,使插件分数低于标准的代码变更无法合并。
报告格式
执行后生成JSON + HTML报告。HTML报告可以可视化比较每个测试用例的with/without结果。
对插件开发者的改变
在这项功能出现之前,插件开发的反馈循环很长:开发 → 手动测试 → 凭"感觉还可以"发布。现在变成:
- 编写测试用例
- 运行
claude plugin eval - 查看Δ值
- 改进低分用例
- 将阈值集成到CI中
插件像代码一样被质量管理的时代到来了。在"用用看就知道了"发布的插件和展示"Δ = +0.31,准确率87%"的插件之间,你会选哪个?
对教育工具开发的启示
从教育科技角度看,这项功能是一个重要的转折点。开发教育专属Claude插件(调整学生语言水平、辅助教师课程设计、生成错误反馈等)的开发者,现在可以用数字证明"这个插件在教育场景中能产生更好的结果"。
使用技巧
- 从5个测试用例开始:缩小范围先确认流水线运行正常,再扩大规模。
- 先用免费的regex评分器:用免费评分器验证基本行为后,再用付费llm评分器深入评估质量。
- 必须设置--max-cost-usd:LLM评分器费用会随测试用例数量急剧增加。
Sources: