资讯

Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills

marktechpost.com·2026/9/11 21:05:55🔗 原文

📋总体概括

Anthropic为Claude Code发布了新的插件评估(plugin evals)工作流。核心是claude plugin eval命令:将插件置于真实提示词下运行,对Claude的产出进行打分,并与未加载插件的基线运行结果对比。该功能回答了此前插件开发者无法量化的三个问题,包括技能是否被正确触发等。配套提供6种评分器类型、无插件基线对照,并支持接入CI流水线作为技能质量的门槛检查,使插件开发从凭感觉转向可测量、可回归验证的工程化流程。

关键信息

  • Anthropic为Claude Code推出插件评估工作流,核心命令为claude plugin eval
  • 评估流程:插件在真实提示词下运行,对Claude产出打分,并与未加载插件的运行结果对比
  • 该功能回答插件开发者此前无法测量的3个问题,包括技能是否被触发
  • 提供6种评分器类型和no-plugin基线对照机制
  • 评估可作为CI门槛(CI gate),将插件质量检查纳入持续集成流程

🔥犀利点评

这是把Agent插件开发从「玄学」拖进工程化的关键一步。此前插件好不好用全靠开发者肉眼感觉——技能触发没有、输出变好没有,全凭信仰。Anthropic用无插件基线对照直接量化插件的边际价值,等于逼着每个插件证明自己「装了比不装强」,这会淘汰一大批蹭流量的垃圾插件。6种评分器加CI门槛,说明Anthropic在为插件生态的规模化质检铺路——生态想做大,没有自动化质量门槛就是灾难。短板是内容未透露评分器的具体实现细节,实际评分是否可靠仍待验证。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文