minssam.
Published on

claude plugin eval:用数字证明插件价值的时代

假设你开发了一个插件。但这个插件真的让Claude运行得更好吗?不是凭直觉,而是用数字来验证。 现在这成为可能了。

2026年9月11日,Anthropic在Claude Code v2.1.269中发布了claude plugin eval命令——一个专门测量插件实际效果的eval工具。


核心理念:"有插件 vs 无插件"

Δ(Delta)的含义

claude plugin eval的设计理念很简单。每个测试用例运行两次:

  • with-arm:插件已加载的状态
  • without-arm:没有插件的基本状态

两个结果的差值,**Δ(Delta)**就是插件的实际贡献值。分数提升说明插件有贡献,下降说明反而产生了干扰。

过去只能依赖"感觉还不错"的直觉。现在可以说Δ = +0.23了。


6种评分器类型

Anthropic提供6种评分器,4种免费,2种付费(基于LLM调用)。

免费评分器(基于转录和文件)

评分器测量对象
regex输出文本中是否存在某个模式
tool_used特定工具是否被调用
tool_order工具是否按规定顺序调用
file_exists特定文件是否被创建

付费评分器(LLM调用)

  • llm:LLM读取输出并评估质量
  • baseline:直接比较with-arm和without-arm的输出,选出更好的一个

集成到CI流水线

核心参数

claude plugin eval --threshold 0.8 --max-cost-usd 20
  • --threshold 0.8:总分低于0.8则构建失败
  • --max-cost-usd 20:LLM评分器费用超过20美元时停止

将这两个参数添加到GitHub Actions或CI流水线中,使插件分数低于标准的代码变更无法合并。

报告格式

执行后生成JSON + HTML报告。HTML报告可以可视化比较每个测试用例的with/without结果。


对插件开发者的改变

在这项功能出现之前,插件开发的反馈循环很长:开发 → 手动测试 → 凭"感觉还可以"发布。现在变成:

  1. 编写测试用例
  2. 运行claude plugin eval
  3. 查看Δ值
  4. 改进低分用例
  5. 将阈值集成到CI中

插件像代码一样被质量管理的时代到来了。在"用用看就知道了"发布的插件和展示"Δ = +0.31,准确率87%"的插件之间,你会选哪个?


对教育工具开发的启示

从教育科技角度看,这项功能是一个重要的转折点。开发教育专属Claude插件(调整学生语言水平、辅助教师课程设计、生成错误反馈等)的开发者,现在可以用数字证明"这个插件在教育场景中能产生更好的结果"。


使用技巧

  • 从5个测试用例开始:缩小范围先确认流水线运行正常,再扩大规模。
  • 先用免费的regex评分器:用免费评分器验证基本行为后,再用付费llm评分器深入评估质量。
  • 必须设置--max-cost-usd:LLM评分器费用会随测试用例数量急剧增加。

Sources:

claude plugin eval:用数字证明插件价值的时代 | MINSSAM.COM