What's new

Leaderboard

Best AI for Math

Models ranked by mathematical reasoning performance across MATH-500, GSM8K, and AIME 2025. Composite score averages available math benchmarks.

# Model Provider Score MATH-500 AIME 2025 GSM8K Input $/M Open Source
1 GPT-5.2 Pro OpenAI 99 98.5 $21 Proprietary
2 GPT-5 Pro OpenAI 98 97.5 $15 Proprietary
3 O3 Pro OpenAI 97 98 96.7 $20 Proprietary
4 o1 OpenAI 96 96.4 $15 Proprietary
5 O4 Mini OpenAI 95 96.3 92.7 $1.1 Proprietary
6 O3 OpenAI 94 96.7 91.6 $2 Proprietary
7 Qwen3 Max Alibaba 94 93.5 $0.78 ✓ Open
8 o3 Mini OpenAI 94 94 $1.1 Proprietary
9 R1 0528 DeepSeek 93 97.8 87.5 $0.5 ✓ Open
10 Qwen3 235B A22B Alibaba 92 92 $0.455 ✓ Open
11 DeepSeek R1 DeepSeek 89 97.3 79.8 $0.7 ✓ Open
12 Claude Opus 4 Anthropic 89 88.7 $15 Proprietary
13 Gemini 2.5 Pro Google 88 90.2 86.7 $1.25 Proprietary
14 Claude Sonnet 4 Anthropic 85 85.4 $3 Proprietary
15 DeepSeek V3.2 DeepSeek 84 84 $0.27 ✓ Open
16 GPT-4.1 OpenAI 83 83 $2 Proprietary
17 Gemini 2.5 Flash Google 82 82.3 $0.3 Proprietary
18 Llama 4 Maverick Meta 82 81.5 $0.2 ✓ Open
19 Phi 4 Microsoft 80 80.4 $0.07 ✓ Open
20 Qwen2.5 72B Instruct Alibaba 80 80 $0.36 ✓ Open
21 DeepSeek V3 DeepSeek 78 78.3 $0.2 ✓ Open
22 Llama 4 Scout Meta 77 76.8 $0.1 ✓ Open
23 GPT-4o (2024-05-13) OpenAI 77 76.6 $5 Proprietary
24 GPT-4o-mini (2024-07-18) OpenAI 70 70.2 $0.15 Proprietary
25 GPT-5.2 OpenAI 45 $1.75 Proprietary
26 Claude Opus 4.6 Anthropic 45 $5 Proprietary
27 GPT-5 OpenAI 44 $1.25 Proprietary
28 Claude Opus 4.5 Anthropic 43 $5 Proprietary
29 Claude Sonnet 4.6 Anthropic 43 $3 Proprietary
30 Qwen2.5 Coder 32B Instruct Alibaba 41 $0.66 ✓ Open
31 Command A Cohere 40 $2.5 ✓ Open
32 Claude Sonnet 4.5 Anthropic 40 $3 Proprietary
33 Command R+ (08-2024) Cohere 40 $2.5 ✓ Open
34 GPT-5 Nano OpenAI 39 $0.05 Proprietary
35 Nova Pro 1.0 Amazon 39 $0.8 Proprietary
36 Llama 3.1 70B Instruct Meta 39 $0.4 ✓ Open
37 Claude Haiku 4.5 Anthropic 38 $1 Proprietary
38 GPT-4.1 Mini OpenAI 38 $0.4 Proprietary
39 GPT-4.1 Nano OpenAI 38 $0.1 Proprietary
40 Gemini 2.5 Flash Lite Google 37 $0.1 Proprietary

Composite score averages available math benchmarks (MATH-500, GSM8K, AIME 2025). Models without benchmark data use a quality-weighted estimate.