ARC-AGI-2 榜首衝上 88.06%

ARC Prize 於 10 月 9 日公布 2026 賽季 ARC-AGI-2 高分榜,TUFA Labs 以 88.06% 排名第一。第二到第五名依序是 Rabbithole(80.56%)、Yi-Chia Chen(77.22%)、Nubanana(77.08%)和 _hans(67.64%)。ARC Prize 共同創辦人 François Chollet 當天也公開提到,Kaggle 上的 ARC-AGI-2 分數已來到 88.06%。

榜首領先第二名約 7.5 個百分點,前五名當中只有 TUFA Labs 超過了 85%。

85% 這條線

ARC-AGI-2 是 Chollet 等人設計的抽象推理測驗。每道題會給幾組彩色網格的輸入與輸出範例,參賽系統要從中歸納出規則,再針對新的輸入畫出正確的網格。每個測試輸入可以提交 2 個答案,任一個完全答對即記 1 分。題目刻意避開靠背誦就能解出的知識。

比賽在 Kaggle 上進行,評測環境不連網,運算資源也有上限。依 2026 賽季規則頁面,總獎金為 70 萬美元:

  • 進步獎 27.5 萬美元,分給前八名,第一名可得 7.5 萬美元;
  • 大獎 27.5 萬美元,頒給評分最高的方案說明;
  • 另設 15 萬美元獎金,門檻是在私有評測集上達到 85%。

所有獲獎方案都必須開源,不開源者會被移出比賽。

有一處口徑需要分開來看。ARC Prize 這次發文表示 15 萬美元由所有超過 85% 的團隊共享,規則頁面卻寫成頒給「第一個」在私有集上達標的合格方案,兩種說法以何者為準,官方目前沒有進一步說明。

另外,Kaggle 公開榜只用大約一半的測試題計分,最終名次由另一半決定。88.06% 是階段性成績,TUFA Labs 能否在私有集上守住 85%,要等賽季結算才知道。

把兩個賽季連起來看

ARC Prize 2025 賽季考的同樣是 ARC-AGI-2。那一年有 1455 支隊伍提交了 15154 次,冠軍 NVARC 在私有集上拿到 24.03%,單題成本約 0.20 美元;第二名 the ARChitects 為 16.53%,大獎無人領走。NVARC 由輝達的兩位 Kaggle 特級大師組成,路線是合成資料、測試時訓練加上小模型,並非用大模型硬跑。

再往前,2024 賽季用的還是第一代 ARC-AGI,冠軍成績在 50% 出頭。ARC-AGI-2 在 2025 年推出時刻意拉高了難度,當時主流的前沿模型在上面普遍只有個位數的得分。

所以 Kaggle 賽道的最佳成績,一年之內從 24% 走到了 88%。兩個數字的口徑不同,前者是私有集終榜,後者是公開榜階段成績,直接相減會高估進步幅度,不過粗看量級的變化依然很大。

TUFA Labs 採用什麼方法,目前沒有公開說明,成績背後的運算消耗與單題成本也未揭露。依規則,獲獎方案必須開源並提交說明,細節最早要等到賽季結束後才看得到。

題目本身還剩多少空間

主辦方在 2025 年發表 ARC-AGI-2 時給出的人類基準是:受測者平均正確率約 60%,每道題都至少有兩名受測者答對。依這個口徑,88% 的公開榜成績已經高於人類受測者的平均水準。

這兩年 ARC Prize 也在把重心轉往互動式的 ARC-AGI-3,新一代題目改成需要邊試邊學的小遊戲。如果 ARC-AGI-2 在本賽季被私有集確認突破 85%,這套靜態網格題作為獎金賽題的任務大概率就要告一段落,主辦方下一步如何安排,目前還沒有公告。

參考來源:ARC Prize 官方帳號、ARC Prize 2026 競賽規則頁面、CocoLoop、ARC Prize 2025 賽季結果分析;用以核對前五名分數、獎金構成與 2025 賽季冠軍成績的計算口徑。