ブリッジウォーターの金融テスト、GPT・Claudeは失敗 — Qwen3ファインチューニングで84.7%達成
ブリッジウォーターの金融テスト、GPT・Claudeは失敗 — Qwen3ファインチューニングで84.7%達成
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-04 |
| 元記事 | The Decoder |
要約
ヘッジファンド大手ブリッジウォーターと元OpenAI CTOが率いるThinking Machines Labが共同で実施した金融タスク評価で、GPTおよびClaudeは正解データが非公開のためスコアが大幅に低下した。ベンチマーク汚染の影響がない独自データセットを使った評価で汎用LLMの限界が明確化された。一方、同プロジェクトがQwen3をファインチューニングしたモデルは84.7%の精度を達成すると主張しており、ドメイン特化型ファインチューニングが金融タスクで汎用モデルを大幅に凌駕することを示す。専門ドメインにおけるAI評価の信頼性と、特化モデル対汎用モデルの実務優位性が問われる事例となった。