Claude Code

Claude Code v2.1.269でplugin eval正式導入 — 6種グレーダー・ベースライン比較・CI/CDゲーティングでプラグイン品質検証がデータドリブンに

元記事を読む(marktechpost.com)

Summary

Claude Code v2.1.269(9月12日リリース)で`claude plugin eval`コマンドが正式導入。プラグインのeval suiteを実行しJSON+HTMLレポートで採点結果を取得可能。各テストケースはプラグイン有無の両方で3回ずつ実行され、プラグインが追加した価値(Δ)を定量化。6種のグレーダー(regex・tool_used・tool_order・file_exists・llm・baseline)のうち4種は無料で実行可能。`claude plugin eval init`で対話的にeval suiteを自動生成。MarkTechPost・AI/TLDR・byteiota等が詳細分析。CI/CDパイプラインでのプラグインスコアゲーティングが可能になりプラグイン品質管理が標準化。`/output-style [name]`でRemote Control・ヘッドレスセッションでの出力スタイル切替も追加。`CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS`でワークフロー同時実行上限を最大256に引き上げ可能。

Key Takeaways

  • `claude plugin eval`でプラグインの品質をデータドリブンに検証可能
  • 6種グレーダーのうち4種(regex・tool_used・tool_order・file_exists)は無料
  • プラグイン有無のベースライン比較でΔ(プラグイン貢献度)を定量化
  • `claude plugin eval init`でeval suite自動生成 — プラグイン開発者の参入障壁が低下
  • CI/CDでプラグインスコアをゲーティング条件に設定可能

Best Practice Updates

  • プラグイン開発者は`claude plugin eval init`でeval suiteを作成しCI/CDに組み込むことを推奨
  • プラグインインストール前にeval結果のΔスコアでプラグインの実効性を確認

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。