My News ← 戻る

ブリッジウォーターの金融テスト、GPT・Claudeは失敗 — Qwen3ファインチューニングで84.7%達成

ブリッジウォーターの金融テスト、GPT・Claudeは失敗 — Qwen3ファインチューニングで84.7%達成

項目 内容
ジャンル AI
日付 2026-07-04
元記事 The Decoder

要約

ヘッジファンド大手ブリッジウォーターと元OpenAI CTOが率いるThinking Machines Labが共同で実施した金融タスク評価で、GPTおよびClaudeは正解データが非公開のためスコアが大幅に低下した。ベンチマーク汚染の影響がない独自データセットを使った評価で汎用LLMの限界が明確化された。一方、同プロジェクトがQwen3をファインチューニングしたモデルは84.7%の精度を達成すると主張しており、ドメイン特化型ファインチューニングが金融タスクで汎用モデルを大幅に凌駕することを示す。専門ドメインにおけるAI評価の信頼性と、特化モデル対汎用モデルの実務優位性が問われる事例となった。


元記事を読む →