Claude API

Claude API: Advisor Tool `max_tokens`パラメータ追加 — advisor sub-inferenceのレイテンシ・コスト制御が可能に

元記事を読む(platform.claude.com)

Summary

7月24日プラットフォームリリースでAdvisor Toolに`max_tokens`パラメータが追加。Advisor sub-inferenceの出力トークン数を上限設定可能に。Advisor Toolパターン(Sonnet 5/Haiku 4.5をexecutor+Opus 5/Fable 5をadvisor)でadvisor推論がストリーミングされずバッチ実行されるため、未制限のadvisor実行は隠れたレイテンシ源となっていた。`max_tokens`設定により簡潔なガイダンスのみ必要なワークロードでレイテンシとトークンコストを同時削減。`stop_reason`フィールドでadvisor出力が上限到達(`max_tokens`)か自然終了(`end_turn`)かを判定可能。advisor sub-inferenceトークンはexecutorのtask budgetから消費されない点は従来通り。

Key Takeaways

  • Advisor Toolの`max_tokens`でadvisor推論の出力上限を設定しレイテンシ・コスト制御が可能に
  • advisor sub-inferenceはストリーミングされないため未制限実行は隠れたレイテンシ増大要因
  • `stop_reason`フィールドでadvisor出力が上限到達か自然終了かを判定可能
  • advisorトークンはexecutorのtask budgetに含まれない — コスト影響はadvisorモデル料金のみ

Best Practice Updates

  • 簡潔なガイダンスのみ必要なワークロードでは`max_tokens`を低値に設定しレイテンシ最適化
  • Advisor Toolパターンでのコスト予測に`max_tokens`による上限を織り込みadvisorコストの予測可能性を向上

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。