Agent · weight 5%智能体 · 权重 5%
τ²-bench
What it tests: Tool-calling agent evaluation in realistic customer-service domains (airline, retail, telecom). The agent must use APIs, follow policies, and handle multi-turn user interactions.
考什么:仿真客服场景的工具调用评测(航空/零售/电信):agent 必须正确调 API、遵守业务规则、处理多轮用户对话。
Why it counts: The most practical agent benchmark — it predicts whether a model will reliably drive tools in production, which raw chat benchmarks can't tell you.
为什么算数:最实用的 Agent benchmark——能预测模型在生产环境调工具的可靠性,这是聊天类 benchmark 看不出来的。
| Maintainer维护方 | Sierra(Anthropic 系创业公司) |
|---|---|
| License许可 | MIT |
| Reference point (prior-gen SOTA)参考点(上一代 SOTA) | 70 |
◈
Standings实时排名
44 models with sourced scores 个模型有溯源成绩| # | Model模型 | Score成绩 | Index指数 | Dated日期 | Measured by测评方 | |
|---|---|---|---|---|---|---|
| 1 | Step 3.7 FlashStepFun | 98.5 | 100 | 2026-06-10 | 3rd-party第三方 | source ↗×5 |
| 2 | Grok 4.3xAI | 97.7⚡high | 99 | 2026-06-10 | 3rd-party第三方 | source ↗×4 |
| 3 | GLM 5.1Z.ai | 97.7⚡high | 99 | 2026-06-10 | 3rd-party第三方 | source ↗×4 |
| 4 | Grok 4.20xAI | 96.5⚡high | 98 | 2026-06-10 | 3rd-party第三方 | source ↗⚠±26.9 |
| 5 | DeepSeek V4 Pro 0423DeepSeek | 96.2⚡max | 98 | 2026-06-10 | 3rd-party第三方 | source ↗×3 |
| 6 | DeepSeek V4 Flash 0423DeepSeek | 95.6⚡high | 97 | 2026-06-10 | 3rd-party第三方 | source ↗×3 |
| 7 | Gemini 3.5 FlashGoogle | 95.3 | 97 | — | 3rd-party第三方 | source ↗×4⚠±20.6 |
| 8 | Qwen3.7 MaxQwen | 94.7 | 96 | 2026-06-10 | 3rd-party第三方 | source ↗×3 |
| 9 | MiMo-V2.5-ProXiaomi | 94.2 | 96 | 2026-06-10 | 3rd-party第三方 | source ↗×2 |
| 10 | Mistral Medium 3.5Mistral AI | 94.2 | 96 | 2026-06-10 | 3rd-party第三方 | source ↗×4 |
| 11 | Seed-2.0-LiteByteDance Seed | 94.2 | 96 | — | vendor-reported厂商自报 | source ↗ |
| 12 | Qwen3.7 PlusQwen | 93 | 94 | 2026-06-10 | 3rd-party第三方 | source ↗×3 |
| 13 | Kimi K2 ThinkingMoonshot AI | 93⚡high | 94 | — | 3rd-party第三方 | source ↗×2 |
| 14 | Hy3Tencent | 92.7⚡high | 94 | 2026-06-10 | 3rd-party第三方 | source ↗⚠±25.2 |
| 15 | Kimi K2.7 CodeMoonshot AI | 90.1 | 91 | — | 3rd-party第三方 | source ↗×3 |
| 16 | MiniMax M3MiniMax | 88.9 | 90 | 2026-06-10 | 3rd-party第三方 | source ↗×3 |
| 17 | GPT-5.6 TerraOpenAI | 86.3 | 88 | — | 3rd-party第三方 | source ↗×3 |
| 18 | Solar Pro 3Upstage | 86.3 | 88 | 2026-06-10 | 3rd-party第三方 | source ↗×2 |
| 19 | MiniMax M2.7MiniMax | 84.8 | 86 | 2026-06-10 | 3rd-party第三方 | source ↗×4 |
| 20 | Nemotron 3 UltraNVIDIA | 83.3⚡high | 85 | 2026-06-10 | 3rd-party第三方 | source ↗×2 |
| 21 | Command ACohere | 80.7 | 82 | 2026-06-10 | 3rd-party第三方 | source ↗×4⚠±48 |
| 22 | Claude Sonnet 5Anthropic | 80.4 | 82 | — | 3rd-party第三方 | source ↗ |
| 23 | DeepSeek V3.2DeepSeek | 80.37 | 82 | 2025-12-01 | official官方榜 | source ↗×6 |
| 24 | Mercury 2Inception | 70.8 | 72 | 2026-06-10 | 3rd-party第三方 | source ↗ |
| 25 | gpt-oss-120bOpenAI | 65.8⚡high | 67 | 2026-06-10 | 3rd-party第三方 | source ↗×2⚠±20.8 |
| 26 | Qwen3.8 Max (0902)Qwen | 55.15⚡max | 56 | 2026-08-04 | official官方榜 | source ↗ |
| 27 | Claude Haiku 4.5Anthropic | 54.7⚡high | 56 | 2026-06-10 | 3rd-party第三方 | source ↗×3⚠±50.5 |
| 28 | Claude Opus 5Anthropic | 48.71⚡max | 49 | 2026-08-04 | official官方榜 | source ↗×3⚠±34.07 |
| 29 | Grok 4.5xAI | 47.94⚡high | 49 | 2026-08-04 | official官方榜 | source ↗ |
| 30 | GPT-5.6 SolOpenAI | 46.9⚡max | 48 | 2026-08-04 | official官方榜 | source ↗×4⚠±38.2 |
| 31 | GPT-5.5OpenAI | 46.39⚡max | 47 | — | official官方榜 | source ↗×7⚠±47.51 |
| 32 | Mistral Small 4Mistral AI | 41.2 | 42 | — | 3rd-party第三方 | source ↗ |
| 33 | Muse Spark 1.1meta | 40.5⚡max | 41 | 2026-08-04 | official官方榜 | source ↗×3⚠±51 |
| 34 | Claude Fable 5Anthropic | 39.69⚡max | 40 | 2026-08-04 | official官方榜 | source ↗×6⚠±58.81 |
| 35 | Claude Opus 4.8Anthropic | 39.69⚡max | 40 | 2026-08-04 | official官方榜 | source ↗×5⚠±54.71 |
| 36 | Nova Premier 1.0Amazon | 38.3 | 39 | 2026-06-10 | 3rd-party第三方 | source ↗ |
| 37 | GLM 5.2Z.ai | 37.11⚡max | 38 | 2026-08-04 | official官方榜 | source ↗×5⚠±61.99 |
| 38 | Kimi K3Moonshot AI | 37.1⚡max | 38 | 2026-08-04 | official官方榜 | source ↗×3⚠±55.9 |
| 39 | Gemini 3.1 Flash LiteGoogle | 31.3 | 32 | 2026-06-10 | 3rd-party第三方 | source ↗ |
| 40 | Gemini 3.1 Pro PreviewGoogle | 26.03⚡high | 26 | 2026-05-05 | official官方榜 | source ↗×6⚠±73.27 |
| 41 | Llama 4 MaverickMeta | 17.8 | 18 | — | 3rd-party第三方 | source ↗×2 |
| 42 | Llama 4 ScoutMeta | 15.5 | 16 | — | 3rd-party第三方 | source ↗×2 |
| 43 | Nova Pro 1.0Amazon | 14 | 14 | — | 3rd-party第三方 | source ↗ |
| 44 | Phi 4Microsoft | 0 | 0 | — | 3rd-party第三方 | source ↗ |