OpenAI、GPT-5.6 SolがARC-AGI-3でOpus 5を上回ると主張するも、独自テスト環境でのみ
OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 but only with its own custom test harness
記事のポイント
📰ニュース
OpenAIがGPT-5.6 SolがAnthropicのOpus 5をARC-AGI-3ベンチマークで上回ったと発表しました。
🔍注目ポイント
GPT-5.6 Solは独自のAPIと推論保持・コンテキスト圧縮を活用し、38.3%のスコアを達成しました。
🔮これからどうなる
AIモデルの評価方法やベンチマークの公平性について、業界内で議論が活発化する可能性があります。
公式テスト環境ではGPT-5.6 Solのスコアは7.8%に留まり、Opus 5は補助なしで30.2%を記録しています。
OpenAIの主張は、独自のテストハーネスを用いた場合に限られるため、その有効性には疑問符がついています。
ベンチマークの公平な比較が課題となっています。
OpenAIの主張は、独自のテストハーネスを用いた場合に限られるため、その有効性には疑問符がついています。
ベンチマークの公平な比較が課題となっています。
OpenAIがGPT-5.6 Solの性能向上をアピールしていますが、独自のテスト環境での結果なので、ベンチマークの公平性が今後の課題になりそうです。ユーザーがモデルを選ぶ際の判断基準にも影響が出そうですね。