哪个 AI 模型最强?
下面的排行榜来自 LMArena:用户同时向两个匿名模型提问,选出更好的回答,系统根据数百万次投票算出得分。它反映真实用户的偏好,不是厂商自己公布的成绩。
综合能力(文字)LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gemini-4-argon-high初步 | 1525 ±9 | 4,932 | |
| 2 | claude-opus-4-6-high | Anthropic | 1505 ±3 | 77,636 |
| 3 | claude-fable-5-high | Anthropic | 1504 ±4 | 38,387 |
| 4 | claude-opus-5.5-high | Anthropic | 1504 ±9 | 4,552 |
| 5 | claude-opus-4-7-high | Anthropic | 1501 ±4 | 64,946 |
| 6 | claude-fable-5.1-max | Anthropic | 1501 ±6 | 11,800 |
| 7 | claude-opus-4-6 | Anthropic | 1497 ±3 | 82,189 |
| 8 | gemini-3.8-flash-high初步 | 1495 ±5 | 26,298 | |
| 9 | muse-spark-1.3-max | Meta | 1494 ±6 | 12,343 |
| 10 | claude-opus-4-7 | Anthropic | 1494 ±4 | 66,058 |
开源模型(文字)LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | kimi-k3-max开源 | Moonshot | 1488 ±5 | 28,280 |
| 2 | mimo-v2.6-pro开源 | Xiaomi | 1480 ±9 | 4,056 |
| 3 | glm-5.3-max开源 | Z.ai | 1478 ±6 | 17,857 |
| 4 | glm-5.2-max开源 | Z.ai | 1476 ±4 | 45,399 |
| 5 | deepseek-v4.1-flash-max开源 | DeepSeek | 1474 ±7 | 8,728 |
| 6 | glm-5.3-flash开源 | Z.ai | 1473 ±5 | 22,971 |
| 7 | mimo-v2.5-pro开源 | Xiaomi | 1468 ±4 | 70,871 |
| 8 | glm-5.1开源 | Z.ai | 1465 ±4 | 58,358 |
| 9 | deepseek-v4-pro-high-20260813开源 | DeepSeek | 1464 ±7 | 9,780 |
| 10 | kimi-k2.6开源 | Moonshot | 1461 ±4 | 39,936 |
编程LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gemini-4-argon-high初步 | 1560 ±17 | 1,230 | |
| 2 | claude-fable-5-high | Anthropic | 1552 ±7 | 10,038 |
| 3 | claude-opus-4-6-high | Anthropic | 1551 ±6 | 20,235 |
| 4 | claude-opus-4-7-high | Anthropic | 1551 ±6 | 18,521 |
| 5 | claude-opus-4-6 | Anthropic | 1548 ±5 | 22,901 |
| 6 | claude-opus-4-7 | Anthropic | 1546 ±6 | 18,728 |
| 7 | gpt-6-astra-max | OpenAI | 1543 ±13 | 2,135 |
| 8 | gpt-6.1-sol-max | OpenAI | 1542 ±24 | 609 |
| 9 | kimi-k3-max开源 | Moonshot | 1541 ±8 | 7,285 |
| 10 | mimo-v2.6-pro开源 | Xiaomi | 1540 ±18 | 1,103 |
网页与应用开发LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | claude-opus-5.5-max | Anthropic | 1815 +16/-16 | 2,062 |
| 2 | gpt-6-astra-max | OpenAI | 1788 +10/-10 | 6,123 |
| 3 | claude-sonnet-5.5-xhigh | Anthropic | 1786 +18/-18 | 1,531 |
| 4 | gpt-6.1-sol-max | OpenAI | 1758 +17/-17 | 1,620 |
| 5 | claude-fable-5.1-max | Anthropic | 1749 +10/-10 | 6,318 |
| 6 | claude-sonnet-5.5-high | Anthropic | 1715 +13/-13 | 2,527 |
| 7 | claude-opus-5-max | Anthropic | 1695 +6/-6 | 16,954 |
| 8 | gpt-6-sol-max | OpenAI | 1689 +11/-11 | 3,411 |
| 9 | gemini-4-argon-high初步 | 1680 +13/-13 | 2,422 | |
| 10 | qwen3.8-max初步 | Alibaba | 1671 +12/-12 | 3,454 |
看懂图片LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | claude-fable-5-high | Anthropic | 1309 ±7 | 13,709 |
| 2 | qwen3.8-max | Alibaba | 1301 ±7 | 10,040 |
| 3 | claude-opus-4-6-high | Anthropic | 1299 ±6 | 22,328 |
| 4 | claude-opus-4-7 | Anthropic | 1298 ±7 | 23,169 |
| 5 | claude-opus-4-7-high | Anthropic | 1298 ±7 | 22,755 |
| 6 | gemini-3.7-flash-high初步 | 1296 ±10 | 3,814 | |
| 7 | claude-opus-4-6 | Anthropic | 1294 ±6 | 26,869 |
| 8 | muse-spark | Meta | 1294 ±9 | 5,868 |
| 9 | muse-spark-1.2 (xHigh) | Meta | 1293 ±14 | 1,951 |
| 10 | gpt-6.1-sol-max | OpenAI | 1291 ±16 | 1,408 |
联网搜索LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gpt-5.6-sol-xhigh | OpenAI | 1257 ±7 | 29,663 |
| 2 | claude-opus-4-6-search | Anthropic | 1253 ±5 | 134,699 |
| 3 | gpt-5.5-search | OpenAI | 1242 ±5 | 89,873 |
| 4 | claude-opus-4-7 | Anthropic | 1233 ±5 | 91,394 |
| 5 | claude-fable-5-high | Anthropic | 1230 ±8 | 41,795 |
| 6 | ernie-5.1 | Baidu | 1227 ±10 | 3,788 |
| 7 | claude-sonnet-4-6-search | Anthropic | 1221 ±5 | 134,905 |
| 8 | grok-4.5 | SpaceXAI | 1213 ±7 | 31,505 |
| 9 | gemini-3.1-pro-grounding | 1210 ±5 | 113,282 | |
| 10 | gemini-3-pro-grounding | 1207 ±6 | 37,024 |
生成图片LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gpt-image-2.5-sunburst初步 | OpenAI | 1425 ±7 | 16,652 |
| 2 | gpt-image-2.5-flare初步 | OpenAI | 1397 ±7 | 15,792 |
| 3 | gpt-image-2 (medium) | OpenAI | 1384 ±4 | 92,549 |
| 4 | grok-imagine-image-2.0 (canvas)初步 | SpaceXAI | 1336 ±12 | 3,070 |
| 5 | mai-image-2.6 | Microsoft AI | 1333 ±5 | 23,918 |
| 6 | reve-2.1 | Reve | 1302 ±8 | 8,250 |
| 7 | grok-imagine-image-2.0 (20260801) | SpaceXAI | 1297 ±6 | 13,278 |
| 8 | muse-image | Meta | 1274 ±5 | 41,071 |
| 9 | reve-2.0 | Reve | 1269 ±6 | 15,774 |
| 10 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1261 ±4 | 59,301 |
修改图片LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gpt-image-2.5-sunburst初步 | OpenAI | 1524 ±5 | 58,172 |
| 2 | gpt-image-2.5-flare初步 | OpenAI | 1481 ±5 | 55,745 |
| 3 | gpt-image-2 (medium) | OpenAI | 1462 ±3 | 304,260 |
| 4 | grok-imagine-image-2.0 (canvas)初步 | SpaceXAI | 1437 ±9 | 10,821 |
| 5 | mai-image-2.6 | Microsoft AI | 1427 ±5 | 50,147 |
| 6 | grok-imagine-image-2.0 (20260801) | SpaceXAI | 1426 ±5 | 48,559 |
| 7 | muse-image | Meta | 1403 ±4 | 141,017 |
| 8 | mai-image-2.5 | Microsoft AI | 1401 ±4 | 190,078 |
| 9 | seedream-5.0-pro | Bytedance | 1394 ±3 | 281,170 |
| 10 | grok-imagine-image-quality (20260519) | SpaceXAI | 1391 ±6 | 38,195 |
生成视频LMArena ↗
| # | 模型 | 开发方 | 得分 | 投票数 |
|---|---|---|---|---|
| 1 | gemini-omni-1.1-flash | 1516 ±15 | 1,784 | |
| 2 | gemini-omni-flash | 1513 ±9 | 26,576 | |
| 3 | flux-3-video初步 | Black Forest Labs | 1493 ±17 | 1,302 |
| 4 | grok-imagine-video-1.5-agent初步 | SpaceXAI | 1492 ±18 | 1,218 |
| 5 | dreamina-seedance-2.0-720p | Bytedance | 1479 ±8 | 56,318 |
| 6 | wan3.0 | Alibaba | 1476 ±13 | 2,598 |
| 7 | dreamina-seedance-2.5-720p | Bytedance | 1474 ±9 | 8,001 |
| 8 | minimax-h3开源 | MiniMax | 1460 ±9 | 11,417 |
| 9 | muse-video | Meta | 1456 ±15 | 2,188 |
| 10 | happyhorse-1.0 | Alibaba-ATH | 1427 ±13 | 22,264 |
模型发布记录
| 日期 | 模型 | 开发方 | API 价格 | 公布的评测成绩(节选) |
|---|---|---|---|---|
| 2026年9月30日 | Google 发布 Gemini 4 Argon | Google DeepMind | 推广期每百万 token 输入 2 美元 / 输出 10 美元,之后为 4 美元 / 20 美元 | DeepSWE v1.1: 77.9% AutomationBench: 51.3% |
| 2026年9月28日 | Claude Sonnet 5.5 发布:日常任务更快,复杂工作仍要看结果 | Anthropic | 每百万 token 输入 2 美元 / 输出 10 美元 | — |
| 2026年9月22日 | Claude Opus 5.5 发布 | Anthropic | 每百万 token 输入 4 美元 / 输出 20 美元;缓存读取 0.20 美元 | Terminal-Bench 4.0: 66.4% Humanity's Last Exam (with tools): 67.7% |
| 2026年9月3日 | OpenAI 发布 GPT-6 Astra | OpenAI | — | ARC-AGI-3: 99.9% |
| 2026年9月1日 | Claude Fable 5.1 与 Mythos 5.1 发布 | Anthropic | 每百万 token 输入 10 美元 / 输出 50 美元;缓存读取 0.25 美元(降低 75%) | — |
| 2026年7月24日 | Claude Opus 5 发布 | Anthropic | 每百万 token 输入 5 美元 / 输出 25 美元 | — |
| 2026年6月9日 | Claude Fable 5 与 Mythos 5 发布 | Anthropic | 每百万 token 输入 10 美元 / 输出 50 美元 | — |
| 2026年4月24日 | DeepSeek V4:开源且支持 100 万 token 上下文 | DeepSeek | — | V4-Pro:总参数 1.6 万亿,激活 490 亿。V4-Flash:总参数 2840 亿,激活 130 亿。上下文 100 万 token。 |
| 2026年2月5日 | Claude Opus 4.6 支持 100 万 token 上下文 | Anthropic | 每百万 token 输入 5 美元 / 输出 25 美元 | 100 万 token 上下文窗口(测试版) |
| 2025年11月24日 | Claude Opus 4.5 发布并降价 | Anthropic | 每百万 token 输入 5 美元 / 输出 25 美元 | — |
| 2025年11月18日 | Google 发布 Gemini 3 | Google DeepMind | — | Humanity's Last Exam (no tools): 37.5% GPQA Diamond: 91.9% |
| 2025年9月29日 | Claude Sonnet 4.5 发布 | Anthropic | — | SWE-bench Verified: 77.2% OSWorld: 61.4% |
| 2025年8月7日 | OpenAI 发布 GPT-5 | OpenAI | — | SWE-bench Verified: 74.9% AIME 2025 (no tools): 94.6% |
| 2025年5月22日 | Anthropic 发布 Claude 4 | Anthropic | — | SWE-bench Verified: 72.5% Terminal-bench: 43.2% |
| 2025年4月5日 | Meta 发布 Llama 4 | Meta | — | Scout:激活参数 170 亿、16 个专家、1000 万 token 上下文。Maverick:激活参数 170 亿、128 个专家。 |
| 2025年3月25日 | Google 发布首个「思考型」模型 Gemini 2.5 | Google DeepMind | — | Humanity's Last Exam (no tools): 18.8% |
| 2025年2月24日 | Claude 3.7 Sonnet 与 Claude Code 发布 | Anthropic | 每百万 token 输入 3 美元 / 输出 15 美元 | SWE-bench Verified: 63.7% |
| 2025年1月20日 | DeepSeek 发布开源推理模型 R1 | DeepSeek | — | AIME 2024 (pass@1): 79.8% MATH-500 (pass@1): 97.3% |