Anthropic

Anthropic Instituteが「AI開発ペース測定メトリクス」を公開 — 30,000同時稼働エージェント・10億決定中0.002%ブロック・R&D 26%リードの3指標で再帰的自己改善の進行度を定量化

元記事を読む(anthropic.com) ↗

Summary

9月17日にAnthropic Instituteが公開し9月24-25日にDigital Applied・CellCog・Mixed News・PANews・Implicator等が追加分析を展開。3つの公開メトリクスを提案: (1)AI主導R&D — ClaudeがAnthropicのAI R&Dの26%を「リード」(2月は1%未満から急上昇)・90%以上で「協業」、(2)エージェント監視 — 最大利用プラットフォームで約30,000エージェントが同時稼働・8月に10億超の決定のうち0.002%(約47,000件に1件)をオンラインモニターがブロック、(3)安全性コンピュート配分 — AI R&Dコンピュートの6%・AI駆動R&Dコンピュートの12%が安全性研究に配分。完全自律(AL5)動作は未達成と明言。他AI企業にも同様メトリクスの定期公開を呼びかけ。全データはAnthropic自己報告で外部監査なし。Digital Appliedは「Coverage(監視範囲)・Latency(レビュー遅延)・Escalation Rate(エスカレーション率)」の3メトリクスフレームワークを詳細分析。

Key Takeaways

  • ▸ 30,000エージェント同時稼働・10億決定中0.002%ブロック — AIエージェント監視の規模と精度が定量的に初公開
  • ▸ R&D 26%「リード」は2月の1%未満から6ヶ月で急上昇 — 再帰的自己改善の進行速度が加速していることを示唆
  • ▸ 安全性コンピュート配分6%(全R&D)・12%(AI駆動R&D)— 安全性投資の定量的開示は業界初
  • ▸ 完全自律(AL5)は未達成 — 現時点では人間監督下の「リード」が最高水準
  • ▸ 全データは自己報告・外部監査なし — 独立検証の仕組み構築が今後の課題
  • ▸ 他AI企業にも同様メトリクスの公開を呼びかけ — 業界横断比較の基盤構築を提案

Best Practice Updates

  • ✓ エージェント監視メトリクス(Coverage・Latency・Escalation Rate)が公式提案 — 自社AIエージェントの監視設計でも同様の3軸フレームワークの適用を検討推奨

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。