2027年末までに少なくとも1つのAIモデルがHumanity's Last Examで75%超のスコアを達成する
2026年6月時点でClaude Fable 5はHumanity's Last Exam(HLE、ツール使用あり)で64.5%を記録し、GPT-5.5の52.2%を12ポイント超上回っている。この予測は、2027年12月末までに少なくとも1つのAIモデルが同ベンチマーク(ツール使用あり条件)で75%超のスコアを達成するという命題を検証する。
根拠
HLEのスコア推移はAIの推論能力向上を鮮明に示している。2025年初頭に公開されたHLEはほぼ全モデルが一桁台だったが、Claude Fable 5は2026年6月に64.5%へ到達した(DataCamp)。18ヶ月で60ポイント超の進展だ。
現在の最前線では、GPT-5.6が間もなく公開予定でFable 5の64.5%に追いつく可能性がある(explainx.ai)。さらに2026年末から2027年にかけて、Anthropic・OpenAI・Google・Meta・xAIから次世代フロンティアモデルが投入される見通しだ。各社の開発ペースを踏まえると、現在の64.5%から75%(+10.5ポイント)は、18ヶ月という期間に対して妥当な到達目標に見える。
なお「75%超」は絶対値として高い基準だが、HLEは人間の専門家でも平均6.3%という難問集であり、AIの進歩がいかに急速かを示すシグナルとして意義がある。
反証・リスク
- スコアリング天井: HLEの上位問題は数学・科学の本質的難問が含まれており、純粋な推論の限界がある。64.5%→75%の10ポイントは、序盤の「拾いやすい問題」に比べて難易度が跳ね上がる可能性がある。
- ベンチマーク飽和・改訂: HLE自体が改訂されたり、コミュニティが「ツール使用条件」を厳格化した場合、比較が難しくなる。
- 進歩の踊り場: 推論モデルの能力向上が2026年後半以降に鈍化する可能性もある(スケーリング則の限界論)。
- 条件変更: 「ツール使用あり」条件での評価が廃止・変更されると、直接比較できない。
確信度の理由
70%と設定した。過去18ヶ月の進捗速度(0%台→64.5%)と、今後18ヶ月の開発競争(OpenAI・Anthropic・Google・Meta の激化)を踏まえると、10ポイント追加は現実的。ただし高得点域での難易度急上昇と、ベンチマーク条件の不変性という不確実性を考慮し、100%ではない。このサイトの予測は確信度70%を「やや有力」と位置づけており、外れるシナリオを具体的に示した上でのこの数値だ。