2027年末までにいずれかのAIモデルがARC-AGI-3公式リーダーボードで20%超のスコアを達成する
2026年3月にリリースされたARC-AGI-3において、Gemini 3.1 Pro(0.37%)、GPT-5.4(0.26%)、Claude Opus 4.6(0.25%)を含む全てのフロンティアAIモデルが1%未満の得点しか記録できていない一方、人間は100%を達成している。この予測は、2027年12月末までに公式リーダーボードで少なくとも1つのシステムが20%超のスコアを記録するという命題を検証する。
根拠
ARC-AGI-3は135のインタラクティブゲーム環境で構成される全く新しい種類のベンチマークだ。ルールも目的も説明なしに、空間推論・物体の永続性・計数といった基礎的認知機能を通じて環境を探索・理解し課題を解くことが求められる(StackBuilt AI)。従来の静的パズルであるARC-AGI-2とは根本的に異なる設計だ。
このベンチマークが注目される理由は、強化学習系アプローチの優位性にある。コミュニティ部門ではCNN+RLを用いたStochasticGoose(Tufa Labs)がプレビュー段階で12.58%を記録し、全フロンティアLLMを大幅に上回った(DataCamp)。この値は公式リーダーボードでは0.25%に落ちたものの、RL特化型アプローチが言語モデルより優れる方向性を示している。
過去の軌跡も参照点になる。ARC-AGI-2はリリース後13ヶ月でトップスコアが~24%(非LLM含む)から77%超へ急上昇した。ARC-AGI-3がはるかに難しい設計であっても、RL・エージェント研究の集中投資が進めば18ヶ月で0%台から20%超へのジャンプは理論的に排除できない。
反証・リスク
- 設計上の耐性: ARC-AGI-3のスコアリングはRHAE(人間のアクション数/AIのアクション数)の二乗で計算され、非効率な試行を極めて重く罰する。ブルートフォースや過去の方法論が通用しにくい構造になっている。
- フロンティアLLMの限界: 現在の言語モデルアーキテクチャはインタラクティブな環境探索に本質的な制約があり、20%は依然として高い壁だ。
- プレビューと本番の乖離: StochasticGooseが示したように、プレビュー時の好成績が公式環境で再現されないリスクがある。
- ベンチマーク改訂: ARC-AGI-4が2027年中にリリースされた場合、3への注目が薄れ研究者の集中投資が起きない可能性がある。
確信度の理由
55%と設定した。20%という閾値は、プレビュー段階で記録されたRL系システムの12.58%を上回る現実的な目標だが、公式リーダーボードでの再現は難しい。ARC-AGI-2の前例(急速な進歩)はポジティブだが、ARC-AGI-3の対話型設計は根本的に難易度が高く、単純な外挿は危険だ。18ヶ月という期間は長いが、20%は依然として人間の100%に対して低い水準であり、AI能力の真の向上を示すシグナルとなる。「やや拮抗」レベルの確信度とする。