Anthropic

Anthropic「Claude Values Across Models and Languages」研究公開 — 309,815会話の分析でモデル・言語によるClaudeの価値表現の違いを初めて定量化

元記事を読む(anthropic.com)

Summary

7月13日にAnthropicが「Claude's values across models and languages」研究を公開。309,815件の匿名化Claude.ai会話をSonnet 4.6・Opus 4.6・Opus 4.7の3モデル・上位20言語で分析し、モデルと言語によるClaudeの価値表現の違いを初めて定量的にマッピング。4つの測定軸(温かさ-厳格さ・深さ-簡潔さ・従順さ-率直さ・慎重さ-実行性)で分類。モデル別ではSonnet 4.6が最も温かさ・従順さ・簡潔さ寄り(ユーモア・遊び心・肯定的フレーミング)、Opus 4.7が最も厳格さ・慎重さ・深さ寄り(仮定への挑戦・作業の率直な批評)。言語別ではヒンディー語・アラビア語で最も温かく(丁寧な表現・ユーモア・肯定)、英語・ロシア語で最も厳格(仮定への疑問・証拠要求)。日本語は中間的位置でバイアスが最も少ないと報告。

Key Takeaways

  • モデル間の「性格」差異が定量的に確認 — Sonnet 4.6は温かく従順(カスタマーサポート・教育向き)、Opus 4.7は厳格で率直(コードレビュー・分析向き)
  • 言語によるClaudeの応答スタイル差異が初めて実証 — 多言語エージェント設計でプロンプトのローカライゼーション必要性が科学的に裏付け
  • 日本語はバイアスが最も少ないと報告 — 中立的な応答スタイルが求められるタスクでの日本語プロンプト利用の参考に
  • 「Values in the Wild」のフォローアップ研究として、Claudeの価値表現を理解することが安全性・整合性の改善につながるとの方針を明示

Best Practice Updates

  • 多言語エージェント設計ではモデル×言語の組み合わせによる応答スタイル差異を認識すべき — Sonnet 4.6+ヒンディー語は最も温かく、Opus 4.7+英語は最も厳格な組み合わせ
  • タスクに応じたモデル選択にClaudeの「性格」特性を活用 — 温かさ重視→Sonnet系、厳格さ・率直さ重視→Opus系

Same Day Signals

すべて見る →

元記事の著作権は各著作者に帰属します。