有据可查的 AI 新闻、模型与产品English

综合能力(文字)LMArena ↗

#模型开发方得分投票数
1gemini-4-argon-high初步Google1525 ±94,932
2claude-opus-4-6-highAnthropic1505 ±377,636
3claude-fable-5-highAnthropic1504 ±438,387
4claude-opus-5.5-highAnthropic1504 ±94,552
5claude-opus-4-7-highAnthropic1501 ±464,946
6claude-fable-5.1-maxAnthropic1501 ±611,800
7claude-opus-4-6Anthropic1497 ±382,189
8gemini-3.8-flash-high初步Google1495 ±526,298
9muse-spark-1.3-maxMeta1494 ±612,343
10claude-opus-4-7Anthropic1494 ±466,058

数据日期:Oct 2, 2026 · 8,626,731 次投票 · 413 个模型

开源模型(文字)LMArena ↗

#模型开发方得分投票数
1kimi-k3-max开源Moonshot1488 ±528,280
2mimo-v2.6-pro开源Xiaomi1480 ±94,056
3glm-5.3-max开源Z.ai1478 ±617,857
4glm-5.2-max开源Z.ai1476 ±445,399
5deepseek-v4.1-flash-max开源DeepSeek1474 ±78,728
6glm-5.3-flash开源Z.ai1473 ±522,971
7mimo-v2.5-pro开源Xiaomi1468 ±470,871
8glm-5.1开源Z.ai1465 ±458,358
9deepseek-v4-pro-high-20260813开源DeepSeek1464 ±79,780
10kimi-k2.6开源Moonshot1461 ±439,936

数据日期:Oct 2, 2026 · 8,626,731 次投票 · 413 个模型

编程LMArena ↗

#模型开发方得分投票数
1gemini-4-argon-high初步Google1560 ±171,230
2claude-fable-5-highAnthropic1552 ±710,038
3claude-opus-4-6-highAnthropic1551 ±620,235
4claude-opus-4-7-highAnthropic1551 ±618,521
5claude-opus-4-6Anthropic1548 ±522,901
6claude-opus-4-7Anthropic1546 ±618,728
7gpt-6-astra-maxOpenAI1543 ±132,135
8gpt-6.1-sol-maxOpenAI1542 ±24609
9kimi-k3-max开源Moonshot1541 ±87,285
10mimo-v2.6-pro开源Xiaomi1540 ±181,103

数据日期:Oct 2, 2026 · 1,848,296 次投票 · 408 个模型

网页与应用开发LMArena ↗

#模型开发方得分投票数
1claude-opus-5.5-maxAnthropic1815 +16/-162,062
2gpt-6-astra-maxOpenAI1788 +10/-106,123
3claude-sonnet-5.5-xhighAnthropic1786 +18/-181,531
4gpt-6.1-sol-maxOpenAI1758 +17/-171,620
5claude-fable-5.1-maxAnthropic1749 +10/-106,318
6claude-sonnet-5.5-highAnthropic1715 +13/-132,527
7claude-opus-5-maxAnthropic1695 +6/-616,954
8gpt-6-sol-maxOpenAI1689 +11/-113,411
9gemini-4-argon-high初步Google1680 +13/-132,422
10qwen3.8-max初步Alibaba1671 +12/-123,454

数据日期:Oct 1, 2026 · 838,388 次投票 · 138 个模型

看懂图片LMArena ↗

#模型开发方得分投票数
1claude-fable-5-highAnthropic1309 ±713,709
2qwen3.8-maxAlibaba1301 ±710,040
3claude-opus-4-6-highAnthropic1299 ±622,328
4claude-opus-4-7Anthropic1298 ±723,169
5claude-opus-4-7-highAnthropic1298 ±722,755
6gemini-3.7-flash-high初步Google1296 ±103,814
7claude-opus-4-6Anthropic1294 ±626,869
8muse-sparkMeta1294 ±95,868
9muse-spark-1.2 (xHigh)Meta1293 ±141,951
10gpt-6.1-sol-maxOpenAI1291 ±161,408

数据日期:Oct 2, 2026 · 1,436,923 次投票 · 159 个模型

生成图片LMArena ↗

#模型开发方得分投票数
1gpt-image-2.5-sunburst初步OpenAI1425 ±716,652
2gpt-image-2.5-flare初步OpenAI1397 ±715,792
3gpt-image-2 (medium)OpenAI1384 ±492,549
4grok-imagine-image-2.0 (canvas)初步SpaceXAI1336 ±123,070
5mai-image-2.6Microsoft AI1333 ±523,918
6reve-2.1Reve1302 ±88,250
7grok-imagine-image-2.0 (20260801)SpaceXAI1297 ±613,278
8muse-imageMeta1274 ±541,071
9reve-2.0Reve1269 ±615,774
10gemini-3.1-flash-image (nano-banana-2) [web-search]Google1261 ±459,301

数据日期:Oct 5, 2026 · 6,583,920 次投票 · 81 个模型

修改图片LMArena ↗

#模型开发方得分投票数
1gpt-image-2.5-sunburst初步OpenAI1524 ±558,172
2gpt-image-2.5-flare初步OpenAI1481 ±555,745
3gpt-image-2 (medium)OpenAI1462 ±3304,260
4grok-imagine-image-2.0 (canvas)初步SpaceXAI1437 ±910,821
5mai-image-2.6Microsoft AI1427 ±550,147
6grok-imagine-image-2.0 (20260801)SpaceXAI1426 ±548,559
7muse-imageMeta1403 ±4141,017
8mai-image-2.5Microsoft AI1401 ±4190,078
9seedream-5.0-proBytedance1394 ±3281,170
10grok-imagine-image-quality (20260519)SpaceXAI1391 ±638,195

数据日期:Oct 5, 2026 · 30,962,085 次投票 · 58 个模型

生成视频LMArena ↗

#模型开发方得分投票数
1gemini-omni-1.1-flashGoogle1516 ±151,784
2gemini-omni-flashGoogle1513 ±926,576
3flux-3-video初步Black Forest Labs1493 ±171,302
4grok-imagine-video-1.5-agent初步SpaceXAI1492 ±181,218
5dreamina-seedance-2.0-720pBytedance1479 ±856,318
6wan3.0Alibaba1476 ±132,598
7dreamina-seedance-2.5-720pBytedance1474 ±98,001
8minimax-h3开源MiniMax1460 ±911,417
9muse-videoMeta1456 ±152,188
10happyhorse-1.0Alibaba-ATH1427 ±1322,264

数据日期:Sep 21, 2026 · 718,577 次投票 · 48 个模型

模型发布记录

以下数据取自厂商官方公告或注明的报道。 评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。

日期模型开发方API 价格公布的评测成绩(节选)
2026年9月30日Google 发布 Gemini 4 ArgonGoogle DeepMind推广期每百万 token 输入 2 美元 / 输出 10 美元,之后为 4 美元 / 20 美元
DeepSWE v1.1: 77.9%
AutomationBench: 51.3%
2026年9月28日Claude Sonnet 5.5 发布:日常任务更快,复杂工作仍要看结果Anthropic每百万 token 输入 2 美元 / 输出 10 美元—
2026年9月22日Claude Opus 5.5 发布Anthropic每百万 token 输入 4 美元 / 输出 20 美元;缓存读取 0.20 美元
Terminal-Bench 4.0: 66.4%
Humanity's Last Exam (with tools): 67.7%
2026年9月3日OpenAI 发布 GPT-6 AstraOpenAI—
ARC-AGI-3: 99.9%
2026年9月1日Claude Fable 5.1 与 Mythos 5.1 发布Anthropic每百万 token 输入 10 美元 / 输出 50 美元;缓存读取 0.25 美元(降低 75%)—
2026年7月24日Claude Opus 5 发布Anthropic每百万 token 输入 5 美元 / 输出 25 美元—
2026年6月9日Claude Fable 5 与 Mythos 5 发布Anthropic每百万 token 输入 10 美元 / 输出 50 美元—
2026年4月24日DeepSeek V4:开源且支持 100 万 token 上下文DeepSeek—V4-Pro:总参数 1.6 万亿,激活 490 亿。V4-Flash:总参数 2840 亿,激活 130 亿。上下文 100 万 token。
2026年2月5日Claude Opus 4.6 支持 100 万 token 上下文Anthropic每百万 token 输入 5 美元 / 输出 25 美元100 万 token 上下文窗口(测试版)
2025年11月24日Claude Opus 4.5 发布并降价Anthropic每百万 token 输入 5 美元 / 输出 25 美元—
2025年11月18日Google 发布 Gemini 3Google DeepMind—
Humanity's Last Exam (no tools): 37.5%
GPQA Diamond: 91.9%
2025年9月29日Claude Sonnet 4.5 发布Anthropic—
SWE-bench Verified: 77.2%
OSWorld: 61.4%
2025年8月7日OpenAI 发布 GPT-5OpenAI—
SWE-bench Verified: 74.9%
AIME 2025 (no tools): 94.6%
2025年5月22日Anthropic 发布 Claude 4Anthropic—
SWE-bench Verified: 72.5%
Terminal-bench: 43.2%
2025年4月5日Meta 发布 Llama 4Meta—Scout:激活参数 170 亿、16 个专家、1000 万 token 上下文。Maverick:激活参数 170 亿、128 个专家。
2025年3月25日Google 发布首个「思考型」模型 Gemini 2.5Google DeepMind—
Humanity's Last Exam (no tools): 18.8%
2025年2月24日Claude 3.7 Sonnet 与 Claude Code 发布Anthropic每百万 token 输入 3 美元 / 输出 15 美元
SWE-bench Verified: 63.7%
2025年1月20日DeepSeek 发布开源推理模型 R1DeepSeek—
AIME 2024 (pass@1): 79.8%
MATH-500 (pass@1): 97.3%