★4 LLM GIGAZINE by Synapse Flow 編集部

NVIDIAのAIエージェント「AVO」がARC-AGI-3で100%を達成、同じベースモデルの別条件での評価は約30%で「実行基盤(ハーネス)」の重要性が示される

記事のポイント

📰ニュース

NVIDIAのAIエージェント「AVO」が、未知の環境での推論能力を測るベンチマーク「ARC-AGI-3」で100%を達成しました。

🔍注目ポイント

AIモデル単体ではなく、記憶やツール利用を担う周辺システム(実行基盤)が、長時間のタスク達成に極めて重要だと示されました。

🔮これからどうなる

AIエージェントの実用化が加速し、より複雑なタスクをAIが自律的に解決できるようになり、私たちの仕事の効率化に繋がります。

AVOは、Claude Opus 5をベースモデルとして使用していますが、ARC Prizeの別評価ではClaude Opus 5単体でのスコアは約30%でした。
この差は、AVOが持つ「Agentic Variation Operators」という実行基盤が、AIの推論能力を最大限に引き出したことを意味します。
AIエージェントの性能は、基盤モデルだけでなく、それをどう活用するかのシステム設計に大きく依存することが明らかになりました。
💡
編集部の視点

NVIDIAのAVOがARC-AGI-3で満点とは驚きですね。AIモデルの性能だけでなく、それを動かす「実行基盤」の重要性が改めて示された形です。今後、AIエージェントが私たちの生活でより複雑な問題を解決してくれるかもしれませんね。

元記事を読む →

関連記事