Math · weight 7%数学 · 权重 7%
FrontierMath
What it tests: Research-level mathematics problems written with active mathematicians, spanning tiers from hard graduate problems to previously unsolved ones.
考什么:与在职数学家合作编写的研究级数学题,难度从研究生难题一路到此前未解的问题。
Why it counts: Where AIME saturates, FrontierMath begins — top models are still around 25-55%, making it the real math differentiator in 2026.
为什么算数:AIME 触顶之后,真正的数学分水岭在这里——头部模型仅 25-55%,2026 年数学能力主要看它。
| Maintainer维护方 | Epoch AI |
|---|---|
| License许可 | 学术访问制 |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 30 |
◈
Standings实时排名
30 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | GLM 5.2Z.ai | 94 | 100 | — | 3rd-party第三方 | source ↗ |
| 2 | Gemini 3.1 Pro PreviewGoogle | 93.7 | 100 | — | official官方榜 | source ↗×3⚠±77 |
| 3 | GPT-5.6 SolOpenAI | 89.12⚡max | 95 | — | 3rd-party第三方 | source ↗×4⚠±6.12 |
| 4 | Claude Fable 5Anthropic | 88⚡max | 94 | — | official官方榜 | source ↗×5⚠±4.6 |
| 5 | GPT-5.5OpenAI | 85⚡max | 90 | — | official官方榜 | source ↗×6⚠±49.9 |
| 6 | GPT-5.6 TerraOpenAI | 84.9 | 90 | — | 3rd-party第三方 | source ↗×2 |
| 7 | GPT-5.6 LunaOpenAI | 78.6 | 84 | — | 3rd-party第三方 | source ↗×2 |
| 8 | MiniMax M3MiniMax | 68.8 | 73 | — | 3rd-party第三方 | source ↗×2⚠±16.9 |
| 9 | DeepSeek V4 Pro 0423DeepSeek | 68.3 | 73 | — | 3rd-party第三方 | source ↗×2⚠±64.13 |
| 10 | Grok 4.20xAI | 67.1 | 71 | — | 3rd-party第三方 | source ↗ |
| 11 | Gemini 3.6 FlashGoogle | 49 | 52 | — | 3rd-party第三方 | source ↗ |
| 12 | Muse Spark 1.1meta | 47.6 | 51 | — | vendor-reported厂商自报 | source ↗ |
| 13 | Claude Opus 4.8Anthropic | 47.241 | 50 | — | 3rd-party第三方 | source ↗×2 |
| 14 | Kimi K3Moonshot AI | 39⚡max | 41 | — | 3rd-party第三方 | source ↗×4 |
| 15 | Gemini 3.5 FlashGoogle | 38.966 | 41 | — | 3rd-party第三方 | source ↗ |
| 16 | Claude Sonnet 5Anthropic | 37.3⚡max | 40 | — | 3rd-party第三方 | source ↗×3⚠±49.7 |
| 17 | Gemini 3.1 Flash LiteGoogle | 36.9 | 39 | — | 3rd-party第三方 | source ↗ |
| 18 | Mistral LargeMistral AI | 36.3 | 39 | — | 3rd-party第三方 | source ↗ |
| 19 | GLM 5.1Z.ai | 33.448 | 36 | — | 3rd-party第三方 | source ↗×2⚠±25.55 |
| 20 | Claude Opus 5Anthropic | 31.25 | 33 | — | 3rd-party第三方 | source ↗×5⚠±56.75 |
| 21 | Qwen3.7 MaxQwen | 23.103 | 25 | — | 3rd-party第三方 | source ↗ |
| 22 | Qwen3.8 Max (0902)Qwen | 23.103 | 25 | — | 3rd-party第三方 | source ↗ |
| 23 | Kimi K2 ThinkingMoonshot AI | 21.404 | 23 | 2026-07-31 | 3rd-party第三方 | source ↗ |
| 24 | Grok 4.5xAI | 19.655 | 21 | — | 3rd-party第三方 | source ↗×2⚠±33.34 |
| 25 | Grok 4.3xAI | 12 | 13 | — | 3rd-party第三方 | source ↗×2 |
| 26 | Claude Haiku 4.5Anthropic | 2.083 | 2 | — | 3rd-party第三方 | source ↗ |
| 27 | Seed-2.0-LiteByteDance Seed | 2.08 | 2 | — | 3rd-party第三方 | source ↗ |
| 28 | DeepSeek V3.2DeepSeek | 2⚡high | 2 | — | 3rd-party第三方 | source ↗×2⚠±20.1 |
| 29 | Llama 4 MaverickMeta | 0.69 | 1 | — | 3rd-party第三方 | source ↗ |
| 30 | Llama 4 ScoutMeta | 0 | 0 | — | 3rd-party第三方 | source ↗ |