ARC-AGI-3 Leaderboard

$1$10$100$1K$10K$100K0%2%4%6%8%10%12%14%16%18%20%Anthropic Opus 4.6 (Max)Grok 4.20 (Beta Reasoning)GPT-5.4 (High)Gemini 3.1 Pro (Preview)GPT-5.5 (High)Opus 4.7 (High)Claude Opus 4.8 (High)GPT-5.6 Sol (Low)GPT-5.6 Sol (Medium)GPT-5.6 Sol (High)GPT-5.6 Sol (xHigh)GPT-5.6 Sol (Max)GPT-5.6 Terra (Low)GPT-5.6 Terra (Medium)GPT-5.6 Terra (High)GPT-5.6 Terra (xHigh)GPT-5.6 Terra (Max)GPT-5.6 Luna (Low)GPT-5.6 Luna (Medium)GPT-5.6 Luna (High)GPT-5.6 Luna (xHigh)GPT-5.6 Luna (Max)COST ($)SCORE (%)
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
Author:
All Authors
All Authors
ARC Prize 2024only
ARC Prize 2025only
Alibabaonly
Anthropiconly
Bespokeonly
Deepseekonly
E. Pangonly
Googleonly
J. Bermanonly
Johan Landonly
Metaonly
Minimaxonly
Mistralonly
Moonshot AIonly
OpenAIonly
Poetiqonly
Z.aionly
xAIonly
Model type:
All Types
All Types
only
Base LLMonly
CoTonly
CoT + Synthesisonly
Customonly
Refinementonly
Model:
All Models
All Models
Qwen3-235b-a22b Instruct (25/07)only
Anthropic Opus 4.6 (Max)only
Claude 3.7only
Claude 3.7 (16K)only
Claude 3.7 (1K)only
Claude 3.7 (8K)only
Claude 4.7 (High)only
Claude 4.7 (Low)only
Claude 4.7 (Max)only
Claude 4.7 (Medium)only
Claude Haiku 4.5only
Claude Haiku 4.5 (Thinking 16K)only
Claude Haiku 4.5 (Thinking 1K)only
Claude Haiku 4.5 (Thinking 32K)only
Claude Haiku 4.5 (Thinking 8K)only
Claude Opus 4only
Claude Opus 4 (Thinking 16K)only
Claude Opus 4 (Thinking 1K)only
Claude Opus 4 (Thinking 8K)only
Claude Opus 4.6 (120K, High)only
Claude Opus 4.6 (120K, Low)only
Claude Opus 4.6 (120K, Max)only
Claude Opus 4.6 (120K, Medium)only
Claude Opus 4.8 (High)only
Claude Opus 4.8 (Low)only
Claude Opus 4.8 (Max)only
Claude Opus 4.8 (Medium)only
Claude Sonnet 4only
Claude Sonnet 4 (Thinking 16K)only
Claude Sonnet 4 (Thinking 1K)only
Claude Sonnet 4 (Thinking 8K)only
Claude Sonnet 4.5only
Claude Sonnet 4.5 (Thinking 16K)only
Claude Sonnet 4.5 (Thinking 1K)only
Claude Sonnet 4.5 (Thinking 32K)only
Claude Sonnet 4.5 (Thinking 8K)only
Claude Sonnet 4.6 (High)only
Claude Sonnet 4.6 (Max)only
Opus 4.5 (Thinking, 16K)only
Opus 4.5 (Thinking, 1K)only
Opus 4.5 (Thinking, 32K)only
Opus 4.5 (Thinking, 64K)only
Opus 4.5 (Thinking, 8K)only
Opus 4.5 (Thinking, None)only
Opus 4.7 (High)only
ARChitectsonly
Icecuberonly
NVARConly
Hierarchical Reasoning Model (HRM)only
Tiny Recursion Model (TRM)only
Deepseek R1only
Deepseek R1 (05/28)only
Deepseek V3.2only
Grok 4 (Refine.)only
Gemini 1.5 Proonly
Gemini 2.0 Flashonly
Gemini 2.5 Flash (Preview)only
Gemini 2.5 Flash (Preview) (Thinking 16K)only
Gemini 2.5 Flash (Preview) (Thinking 1K)only
Gemini 2.5 Flash (Preview) (Thinking 24K)only
Gemini 2.5 Flash (Preview) (Thinking 8K)only
Gemini 2.5 Pro (Preview, Thinking 1K)only
Gemini 2.5 Pro (Preview)only
Gemini 2.5 Pro (Thinking 16K)only
Gemini 2.5 Pro (Thinking 1K)only
Gemini 2.5 Pro (Thinking 32K)only
Gemini 2.5 Pro (Thinking 8K)only
Gemini 3 Deep Think (2/26)only
Gemini 3 Deep Think (Preview) ²only
Gemini 3 Flash Preview (High)only
Gemini 3 Flash Preview (Low)only
Gemini 3 Flash Preview (Medium)only
Gemini 3 Flash Preview (Minimal)only
Gemini 3 Proonly
Gemini 3.1 Pro (Preview)only
Gemini 3.1 Pro (Preview)only
Gemini 3.5 Flash (High)only
Gemini 3.5 Flash (Minimal)only
Grok 4 (Refine.)only
GPT-5.2 (Refine.)only
Llama 4 Maverickonly
Llama 4 Scoutonly
Minimax M2.5only
Magistral Mediumonly
Magistral Medium (Thinking)only
Magistral Smallonly
Kimi K2.5only
Codex Mini (Latest)only
GPT-4.1only
GPT-4.1-Minionly
GPT-4.1-Nanoonly
GPT-4.5only
GPT-4oonly
GPT-4o-minionly
GPT-5 (High)only
GPT-5 (Low)only
GPT-5 (Medium)only
GPT-5 (Minimal)only
GPT-5 Mini (High)only
GPT-5 Mini (Low)only
GPT-5 Mini (Medium)only
GPT-5 Mini (Minimal)only
GPT-5 Nano (High)only
GPT-5 Nano (Low)only
GPT-5 Nano (Medium)only
GPT-5 Nano (Minimal)only
GPT-5 Proonly
GPT-5.1 (Thinking, High)only
GPT-5.1 (Thinking, Low)only
GPT-5.1 (Thinking, Medium)only
GPT-5.1 (Thinking, None)only
GPT-5.2only
GPT-5.2 (High)only
GPT-5.2 (Low)only
GPT-5.2 (Medium)only
GPT-5.2 (xHigh)only
GPT-5.2 Pro (High)only
GPT-5.2 Pro (Medium)only
GPT-5.2 Pro (xHigh)only
GPT-5.4 (High)only
GPT-5.4 (High)only
GPT-5.4 (Low)only
GPT-5.4 (Medium)only
GPT-5.4 (xHigh)only
GPT-5.4 Mini (High)only
GPT-5.4 Mini (Low)only
GPT-5.4 Mini (Medium)only
GPT-5.4 Mini (xHigh)only
GPT-5.4 Nano (High)only
GPT-5.4 Nano (Low)only
GPT-5.4 Nano (Medium)only
GPT-5.4 Nano (xHigh)only
GPT-5.4 Pro (xHigh)only
GPT-5.5 (High)only
GPT-5.5 (High)only
GPT-5.5 (Low)only
GPT-5.5 (Medium)only
GPT-5.5 (xHigh)only
GPT-5.5 Pro (High)only
GPT-5.5 Pro (xHigh)only
GPT-5.6 Luna (High)only
GPT-5.6 Luna (Low)only
GPT-5.6 Luna (Max)only
GPT-5.6 Luna (Medium)only
GPT-5.6 Luna (xHigh)only
GPT-5.6 Sol (High)only
GPT-5.6 Sol (Low)only
GPT-5.6 Sol (Max)only
GPT-5.6 Sol (Medium)only
GPT-5.6 Sol (xHigh)only
GPT-5.6 Terra (High)only
GPT-5.6 Terra (Low)only
GPT-5.6 Terra (Max)only
GPT-5.6 Terra (Medium)only
GPT-5.6 Terra (xHigh)only
o1-minionly
o3 (High)only
o3 (Low)only
o3 (Medium)only
o3 (Preview, Low) ¹only
o3-mini (High)only
o3-mini (Low)only
o3-mini (Medium)only
o3-Pro (High)only
o3-Pro (Low)only
o3-Pro (Medium)only
o4-mini (High)only
o4-mini (Low)only
o4-mini (Medium)only
Gemini 3 Pro (Refine.)only
Grok 3only
Grok 3 Mini (Low)only
Grok 4 (Fast Reasoning)only
Grok 4 (Thinking)only
Grok 4.20 (Beta Reasoning)only
Grok 4.20 (Reasoning)only
GLM-5only
GLM-5.2only

Understanding the Leaderboard

ARC-AGI has evolved from its first versions (ARC-AGI-1 and 2) which measured passive fluid intelligence, to ARC-AGI-3 which challenges AI agents to adapt on the fly to novel interactive environments.

The scatter plot above visualizes the critical relationship between cost-per-task and performance - a key measure of efficiency. True intelligence isn't just about solving problems, but solving them efficiently with minimal resources.

Interpreting the data

Verification Policy

For more information, see our testing policy.

Leaderboard Breakdown

AI SystemAuthorDateSystem TypeARC-AGI-1ARC-AGI-2ARC-AGI-3Cost/TaskCost (V3)Code / Paper
GPT-5.6 Sol (Low)OpenAI2026-07-09CoT74.5%42.5%0.3%$0.320$12.8K
GPT-5.6 Sol (Medium)OpenAI2026-07-09CoT92.5%67.1%1.1%$0.470$13.0K
GPT-5.6 Sol (High)OpenAI2026-07-09CoT97.0%85.4%2.1%$0.740$15.2K
GPT-5.6 Sol (xHigh)OpenAI2026-07-09CoT97.5%90.0%7.0%$1.04$19.2K
GPT-5.6 Sol (Max)OpenAI2026-07-09CoT96.5%92.5%7.8%$1.44$25.1K
GPT-5.6 Terra (Low)OpenAI2026-07-09CoT60.2%18.8%0.0%$0.170$5.1K
GPT-5.6 Terra (Medium)OpenAI2026-07-09CoT77.0%37.5%0.1%$0.270$5.9K
GPT-5.6 Terra (High)OpenAI2026-07-09CoT92.0%67.1%0.5%$0.550$5.9K
GPT-5.6 Terra (xHigh)OpenAI2026-07-09CoT94.0%74.2%0.7%$0.690$6.8K
GPT-5.6 Terra (Max)OpenAI2026-07-09CoT96.5%83.9%0.8%$1.09$7.9K
GPT-5.6 Luna (Low)OpenAI2026-07-09CoT34.2%5.1%0.2%$0.070$2.3K
GPT-5.6 Luna (Medium)OpenAI2026-07-09CoT56.5%7.4%0.2%$0.110$2.4K
GPT-5.6 Luna (High)OpenAI2026-07-09CoT76.5%29.3%0.1%$0.290$2.5K
GPT-5.6 Luna (xHigh)OpenAI2026-07-09CoT87.7%47.6%0.0%$0.540$2.8K
GPT-5.6 Luna (Max)OpenAI2026-07-09CoT88.0%59.5%0.2%$0.670$3.2K
GLM-5.2Z.ai2026-06-13CoT77.0%22.8%N/A$0.250N/A
Claude Opus 4.8 (Low)Anthropic2026-06-01CoT88.0%62.2%N/A$1.68N/A
Claude Opus 4.8 (Medium)Anthropic2026-06-01CoT91.5%71.7%N/A$2.39N/A
Claude Opus 4.8 (High)Anthropic2026-06-01CoT92.0%72.1%1.5%$2.74$10.0K
Claude Opus 4.8 (Max)Anthropic2026-06-01CoT92.5%N/AN/A$2.33N/A
Gemini 3.5 Flash (Minimal)Google2026-05-19CoT48.8%8.9%N/A$0.107N/A
Gemini 3.5 Flash (High)Google2026-05-19CoT92.5%72.1%N/A$0.850N/A
GPT-5.5 Pro (High)OpenAI2026-04-23CoT96.5%84.6%N/A$10.51N/A
GPT-5.5 Pro (xHigh)OpenAI2026-04-23CoT95.0%84.2%N/A$10.76N/A
GPT-5.5 (High)OpenAI2026-04-23CoTN/AN/A0.4%N/A$10.0K
GPT-5.5 (Low)OpenAI2026-04-22CoT76.2%33.3%N/A$0.350N/A
GPT-5.5 (Medium)OpenAI2026-04-22CoT92.2%70.4%N/A$0.860N/A
GPT-5.5 (High)OpenAI2026-04-22CoT94.5%83.3%N/A$1.45N/A
GPT-5.5 (xHigh)OpenAI2026-04-22CoT95.0%85.0%N/A$1.87N/A
Claude 4.7 (Low)Anthropic2026-04-16CoT91.0%62.1%N/A$2.38N/A
Claude 4.7 (Medium)Anthropic2026-04-16CoT91.0%67.5%N/A$2.96N/A
Claude 4.7 (High)Anthropic2026-04-16CoT93.5%68.3%N/A$3.17N/A
Claude 4.7 (Max)Anthropic2026-04-16CoT92.0%75.8%N/A$7.43N/A
Opus 4.7 (High)Anthropic2026-04-16CoTN/AN/A0.2%N/A$10.0K
GPT-5.4 Mini (xHigh)OpenAI2026-03-17CoT63.7%18.9%N/A$0.750N/A
GPT-5.4 Mini (High)OpenAI2026-03-17CoT58.0%13.2%N/A$0.560N/A
GPT-5.4 Mini (Medium)OpenAI2026-03-17CoT40.8%4.4%N/A$0.330N/A
GPT-5.4 Mini (Low)OpenAI2026-03-17CoT13.0%1.1%N/A$0.060N/A
GPT-5.4 Nano (xHigh)OpenAI2026-03-17CoT51.5%5.7%N/A$0.160N/A
GPT-5.4 Nano (High)OpenAI2026-03-17CoT38.2%3.6%N/A$0.130N/A
GPT-5.4 Nano (Medium)OpenAI2026-03-17CoT33.0%1.9%N/A$0.060N/A
GPT-5.4 Nano (Low)OpenAI2026-03-17CoT18.3%1.5%N/A$0.010N/A
Grok 4.20 (Reasoning)xAI2026-03-09CoT89.5%65.1%N/A$0.920N/A
Grok 4.20 (Beta Reasoning)xAI2026-03-05CoTN/AN/A0.1%N/A$3.8K
GPT-5.4 (High)OpenAI2026-03-05CoTN/AN/A0.2%N/A$5.2K
Gemini 3.1 Pro (Preview)Google2026-03-05CoTN/AN/A0.4%N/A$2.2K
GPT-5.4 (Low)OpenAI2026-03-04CoT68.2%29.2%N/A$0.270N/A
GPT-5.4 (Medium)OpenAI2026-03-04CoT86.2%55.4%N/A$0.680N/A
GPT-5.4 (High)OpenAI2026-03-04CoT92.7%67.5%N/A$1.02N/A
GPT-5.4 (xHigh)OpenAI2026-03-04CoT93.7%74.0%N/A$1.52N/A
GPT-5.4 Pro (xHigh)OpenAI2026-03-04CoT94.5%83.3%N/A$16.41N/A
GLM-5Z.ai2026-02-20CoT44.7%4.9%N/A$0.270N/A
Gemini 3.1 Pro (Preview)Google2026-02-19CoT98.0%77.1%N/A$0.962N/A📄
Claude Sonnet 4.6 (Max)Anthropic2026-02-17CoT86.0%58.3%N/A$2.72N/A
Claude Sonnet 4.6 (High)Anthropic2026-02-17CoT86.5%60.4%N/A$2.70N/A
Gemini 3 Deep Think (Preview) ²Google2026-02-12CoT87.5%45.1%N/A$77.16N/A
Gemini 3 Deep Think (2/26)Google2026-02-12CoT96.0%84.6%N/A$13.62N/A
Minimax M2.5Minimax2026-02-12CoT63.7%4.9%N/A$0.170N/A
Claude Opus 4.6 (120K, Low)Anthropic2026-02-05CoT86.0%64.6%N/A$2.25N/A
Claude Opus 4.6 (120K, Medium)Anthropic2026-02-05CoT92.0%66.3%N/A$2.72N/A
Claude Opus 4.6 (120K, High)Anthropic2026-02-05CoT94.0%69.2%N/A$3.47N/A
Claude Opus 4.6 (120K, Max)Anthropic2026-02-05CoT93.0%68.8%N/A$3.64N/A
GPT-5.2 (Refine.)Johan Land2026-02-03Refinement94.5%72.9%N/A$38.99N/A📄💻
Kimi K2.5Moonshot AI2026-01-27CoT65.3%11.8%N/A$0.280N/A
Gemini 3 Flash Preview (Minimal)Google2025-12-17CoT21.5%3.3%N/A$0.021N/A
Gemini 3 Flash Preview (Low)Google2025-12-17CoT29.0%1.3%N/A$0.025N/A
Gemini 3 Flash Preview (Medium)Google2025-12-17CoT57.7%12.8%N/A$0.082N/A
Gemini 3 Flash Preview (High)Google2025-12-17CoT84.7%33.6%N/A$0.231N/A
Anthropic Opus 4.6 (Max)Anthropic2025-12-17CoTN/AN/A0.5%N/A$8.9K
GPT-5.2OpenAI2025-12-11Base LLM12.3%0.8%N/A$0.082N/A
GPT-5.2 (Low)OpenAI2025-12-11CoT55.7%9.7%N/A$0.264N/A
GPT-5.2 (Medium)OpenAI2025-12-11CoT72.7%26.7%N/A$0.759N/A
GPT-5.2 (High)OpenAI2025-12-11CoT78.7%43.3%N/A$1.39N/A
GPT-5.2 (xHigh)OpenAI2025-12-11CoT86.2%52.9%N/A$1.90N/A
GPT-5.2 Pro (Medium)OpenAI2025-12-11CoT81.2%38.5%N/A$8.99N/A
GPT-5.2 Pro (High)OpenAI2025-12-11CoT85.7%54.2%N/A$15.72N/A
GPT-5.2 Pro (xHigh)OpenAI2025-12-11CoT90.5%N/AN/A$11.65N/A
Gemini 3 Pro (Refine.)Poetiq2025-12-04RefinementN/A54.0%N/A$30.57N/A
Deepseek V3.2Deepseek2025-12-01Base LLM57.0%4.0%N/A$0.120N/A
Opus 4.5 (Thinking, None)Anthropic2025-11-24CoT40.0%7.8%N/A$0.220N/A
Opus 4.5 (Thinking, 1K)Anthropic2025-11-24CoT35.2%9.4%N/A$0.230N/A
Opus 4.5 (Thinking, 8K)Anthropic2025-11-24CoT58.7%13.9%N/A$0.480N/A
Opus 4.5 (Thinking, 16K)Anthropic2025-11-24CoT72.0%22.8%N/A$0.790N/A
Opus 4.5 (Thinking, 32K)Anthropic2025-11-24CoT75.8%30.6%N/A$1.29N/A
Opus 4.5 (Thinking, 64K)Anthropic2025-11-24CoT80.0%37.6%N/A$2.40N/A
Gemini 3 ProGoogle2025-11-18CoT75.0%31.1%N/A$0.811N/A
GPT-5.1 (Thinking, None)OpenAI2025-11-13CoT5.8%0.4%N/A$0.058N/A
GPT-5.1 (Thinking, Low)OpenAI2025-11-13CoT33.2%1.9%N/A$0.129N/A
GPT-5.1 (Thinking, Medium)OpenAI2025-11-13CoT57.7%6.5%N/A$0.421N/A
GPT-5.1 (Thinking, High)OpenAI2025-11-13CoT72.8%17.6%N/A$1.17N/A
Grok 4 (Fast Reasoning)xAI2025-10-21CoT48.5%5.3%N/A$0.061N/A📄
Tiny Recursion Model (TRM)Bespoke2025-10-07N/A40.0%6.3%N/A$2.10N/A📄💻
GPT-5 ProOpenAI2025-10-06CoT70.2%18.3%N/A$7.14N/A📄
Claude Haiku 4.5Anthropic2025-10-01Base LLM14.3%1.3%N/A$0.043N/A📄
Claude Haiku 4.5 (Thinking 1K)Anthropic2025-10-01CoT16.8%1.3%N/A$0.047N/A📄
Claude Haiku 4.5 (Thinking 8K)Anthropic2025-10-01CoT25.5%1.7%N/A$0.091N/A📄
Claude Haiku 4.5 (Thinking 16K)Anthropic2025-10-01CoT37.3%2.8%N/A$0.139N/A📄
Claude Haiku 4.5 (Thinking 32K)Anthropic2025-10-01CoT47.7%4.0%N/A$0.377N/A📄
Claude Sonnet 4.5Anthropic2025-09-29Base LLM25.5%3.8%N/A$0.130N/A📄
Claude Sonnet 4.5 (Thinking 1K)Anthropic2025-09-29CoT31.0%5.8%N/A$0.142N/A📄
Claude Sonnet 4.5 (Thinking 8K)Anthropic2025-09-29CoT46.5%6.9%N/A$0.235N/A📄
Claude Sonnet 4.5 (Thinking 16K)Anthropic2025-09-29CoT48.3%6.9%N/A$0.350N/A📄
Claude Sonnet 4.5 (Thinking 32K)Anthropic2025-09-29CoT63.7%13.6%N/A$0.759N/A📄
GPT-5 (High)OpenAI2025-08-07CoT65.7%9.9%N/A$0.730N/A
GPT-5 (Medium)OpenAI2025-08-07CoT56.2%7.5%N/A$0.449N/A
GPT-5 (Low)OpenAI2025-08-07CoT44.0%1.9%N/A$0.190N/A
GPT-5 (Minimal)OpenAI2025-08-07Base LLM6.0%0.0%N/A$0.056N/A
GPT-5 Mini (High)OpenAI2025-08-07CoT54.3%4.4%N/A$0.198N/A
GPT-5 Mini (Medium)OpenAI2025-08-07CoT37.3%4.0%N/A$0.063N/A
GPT-5 Mini (Low)OpenAI2025-08-07CoT26.3%0.8%N/A$0.019N/A
GPT-5 Mini (Minimal)OpenAI2025-08-07CoT5.3%1.7%N/A$0.009N/A
GPT-5 Nano (High)OpenAI2025-08-07CoT16.7%2.6%N/A$0.029N/A
GPT-5 Nano (Medium)OpenAI2025-08-07CoT20.7%0.9%N/A$0.014N/A
GPT-5 Nano (Low)OpenAI2025-08-07CoT4.0%0.0%N/A$0.003N/A
GPT-5 Nano (Minimal)OpenAI2025-08-07CoT1.5%0.0%N/A$0.003N/A
Hierarchical Reasoning Model (HRM)Bespoke2025-08-07N/A32.0%2.0%N/A$1.68N/A
Grok 4 (Refine.)J. Berman2025-08-07Refinement79.6%29.4%N/A$30.40N/A💻
Grok 4 (Refine.)E. Pang2025-08-07Refinement77.1%26.0%N/A$3.97N/A💻
Qwen3-235b-a22b Instruct (25/07)Alibaba2025-07-25Base LLM11.0%1.3%N/A$0.004N/A📄
Grok 4 (Thinking)xAI2025-07-09CoT66.7%16.0%N/A$2.17N/A📄
Gemini 2.5 Pro (Thinking 1K)Google2025-06-17CoT16.0%0.0%N/A$0.088N/A📄
Gemini 2.5 Pro (Thinking 8K)Google2025-06-17CoT29.5%2.9%N/A$0.444N/A📄
Gemini 2.5 Pro (Thinking 16K)Google2025-06-17CoT41.0%4.0%N/A$0.715N/A📄
Gemini 2.5 Pro (Thinking 32K)Google2025-06-17CoT37.0%4.9%N/A$0.757N/A📄
o3-Pro (Low)OpenAI2025-06-10CoT + Synthesis44.3%2.1%N/A$2.23N/A📄
o3-Pro (Medium)OpenAI2025-06-10CoT + Synthesis57.0%1.9%N/A$4.74N/A📄
o3-Pro (High)OpenAI2025-06-10CoT + Synthesis59.3%4.9%N/A$7.55N/A📄
Magistral SmallMistral2025-06-10CoT5.0%0.0%N/A$0.049N/A📄
Magistral MediumMistral2025-06-10CoT5.9%0.0%N/A$0.108N/A📄
Magistral Medium (Thinking)Mistral2025-06-10CoT6.1%0.0%N/A$0.123N/A📄
Deepseek R1 (05/28)Deepseek2025-05-28CoT21.2%1.1%N/A$0.053N/A📄
Codex Mini (Latest)OpenAI2025-05-23CoT27.3%1.3%N/A$0.230N/A📄
Gemini 2.5 Flash (Preview)Google2025-05-20CoT33.3%1.7%N/A$0.057N/A📄💻
Gemini 2.5 Flash (Preview) (Thinking 1K)Google2025-05-20CoT16.0%2.2%N/A$0.030N/A📄💻
Gemini 2.5 Flash (Preview) (Thinking 8K)Google2025-05-20CoT25.8%2.1%N/A$0.199N/A📄💻
Gemini 2.5 Flash (Preview) (Thinking 16K)Google2025-05-20CoT33.3%2.0%N/A$0.317N/A📄💻
Gemini 2.5 Flash (Preview) (Thinking 24K)Google2025-05-20CoT32.3%2.5%N/A$0.319N/A📄💻
Claude Sonnet 4Anthropic2025-05-14Base LLM23.8%1.3%N/A$0.127N/A📄
Claude Sonnet 4 (Thinking 1K)Anthropic2025-05-14CoT28.0%0.9%N/A$0.142N/A📄
Claude Sonnet 4 (Thinking 8K)Anthropic2025-05-14CoT29.0%2.1%N/A$0.265N/A📄
Claude Sonnet 4 (Thinking 16K)Anthropic2025-05-14CoT40.0%5.9%N/A$0.486N/A📄
Claude Opus 4 (Thinking 16K)Anthropic2025-05-14CoT35.7%8.6%N/A$1.93N/A📄
Claude Opus 4 (Thinking 8K)Anthropic2025-05-14CoT30.7%4.5%N/A$1.16N/A📄
Claude Opus 4 (Thinking 1K)Anthropic2025-05-14CoT27.0%0.0%N/A$0.750N/A📄
Claude Opus 4Anthropic2025-05-14CoT22.5%1.3%N/A$0.639N/A📄
o3 (Low)OpenAI2025-04-16CoT41.5%2.0%N/A$0.234N/A
o3 (Medium)OpenAI2025-04-16CoT53.8%3.0%N/A$0.479N/A
o3 (High)OpenAI2025-04-16CoT60.8%6.5%N/A$0.834N/A
o4-mini (Low)OpenAI2025-04-16CoT21.3%1.7%N/A$0.050N/A
o4-mini (Medium)OpenAI2025-04-16CoT41.8%2.4%N/A$0.231N/A
o4-mini (High)OpenAI2025-04-16CoT58.7%6.1%N/A$0.856N/A
GPT-4.1-NanoOpenAI2025-04-14Base LLM0.0%0.0%N/A$0.004N/A📄💻
GPT-4.1-MiniOpenAI2025-04-14Base LLM3.5%0.0%N/A$0.014N/A📄💻
GPT-4.1OpenAI2025-04-14Base LLM5.5%0.4%N/A$0.069N/A📄💻
Llama 4 MaverickMeta2025-04-05Base LLM4.4%0.0%N/A$0.012N/A📄💻
Llama 4 ScoutMeta2025-04-05Base LLM0.5%0.0%N/A$0.006N/A📄💻
GPT-4.5OpenAI2025-02-27Base LLM10.3%0.8%N/A$2.10N/A💻
Claude 3.7Anthropic2025-02-24Base LLM13.6%0.0%N/A$0.120N/A💻
Claude 3.7 (16K)Anthropic2025-02-24CoT28.6%0.7%N/A$0.510N/A💻
Claude 3.7 (1K)Anthropic2025-02-24CoT11.6%0.4%N/A$0.140N/A💻
Claude 3.7 (8K)Anthropic2025-02-24CoT21.2%0.9%N/A$0.360N/A💻
Grok 3xAI2025-02-19Base LLM5.5%0.0%N/A$0.142N/A📄
Grok 3 Mini (Low)xAI2025-02-19CoT16.5%0.4%N/A$0.013N/A📄
Gemini 2.5 Pro (Preview)Google2025-02-19CoT33.0%3.8%N/A$0.813N/A📄
Gemini 2.5 Pro (Preview, Thinking 1K)Google2025-02-19CoT31.3%3.4%N/A$0.804N/A📄
Gemini 1.5 ProGoogle2025-02-15Base LLMN/A0.8%N/A$0.040N/A💻
Gemini 2.0 FlashGoogle2025-02-02Base LLMN/A1.3%N/A$0.004N/A💻
o3-mini (Low)OpenAI2025-01-31CoT14.5%0.0%N/A$0.062N/A
o3-mini (Medium)OpenAI2025-01-31CoT22.3%2.1%N/A$0.284N/A
o3-mini (High)OpenAI2025-01-31CoT34.5%3.0%N/A$0.547N/A
Deepseek R1Deepseek2025-01-22CoT15.8%1.3%N/A$0.080N/A💻
o3 (Preview, Low) ¹OpenAI2024-12-20CoT + Synthesis75.7%4.0%N/A$200.00N/A📄
GPT-4oOpenAI2024-11-20Base LLM4.5%0.0%N/A$0.080N/A💻
ARChitectsARC Prize 20242024-11-03Custom56.0%2.5%N/A$0.200N/A📄💻
NVARCARC Prize 20252024-11-03CustomN/A27.6%N/A$0.200N/A📄💻
o1-miniOpenAI2024-09-12CoT14.0%0.8%N/A$0.191N/A📄💻
GPT-4o-miniOpenAI2024-07-18Base LLMN/A0.0%N/A$0.010N/A💻
IcecuberARC Prize 20242023-11-03Custom17.0%1.6%N/A$0.130N/A💻
Human PanelHumanN/AN/A98.0%100.0%N/A$17.00N/A
Avg. MturkerHumanN/AN/A77.0%N/AN/A$3.00N/A
Stem GradHumanN/AN/A98.0%N/AN/A$10.00N/A

Notes

Only systems which required less than $10,000 to run are shown.

For models that were not able to produce full test out puts, remaining tasks were marked as incorrect.

Results marked as "preview" are unofficial and may be based on incomplete testing.

1 ARC-AGI-2 score estimate based on partial testing results and o1-pro pricing.

2 Provisional cost estimates based on Gemini 3 Pro pricing. Model to be retested once released.