AI 模型榜单日报 | 202620 走进 LMArena

AI 模型榜单日报 | 2026-08-20 走进 LMArena 五张榜:怎么算分、怎么编号,一篇替你拆完

各位模型观察家好,这里是 AI 全球模型排行。

榜单一刷就是一周,看多了大家迟早会冒出那个问题:LMArena 这五张榜到底怎么算分的,凭什么同一个模型在不同子榜里能差出一大截?Qwen3.8-Max 后面那个 (Max) 是什么意思?为什么突然冒出 GPT 5.6 Sol 这么多没见过的名字?今天换张面孔,把 LMArena 当主角拆一遍,配上五张今天生成的可视化,一次给你说透。


LMArena 怎么算分

LMArena(原 LMSys Chatbot Arena)所有榜单共用一套底层规则:把两个模型的回答并排摆出来,让真人匿名投票谁更好,然后用 Bradley-Terry 模型换算成分数。区别只在于评分系统和投票领域:

说人话:文本榜看回答谁更像人,WebDev 看代码能不能直接跑出来,视觉榜比拼多模态理解,Agent Arena 看模型能不能真把活干完。


① 文本总榜:Anthropic 一家独大,国产卡在 6

榜单 ① 是官网默认首页那张,分数都在 1500 档附近。前五全被 Claude 包了——Opus 5 (Max) 1507.78 一骑绝尘,往下 Opus 5 (High) 1505.34、Opus 4.6 (High) 1502.80、Opus 4.6 1497.09、Fable 5 1493.30,前五分差不到 15 分。唯一钻进前十的国产是 Qwen3.8 Max,1491.71 列第 6,跟 Fable 5 只差 1.59 ELO——这一寸之地国产顶配已经守了快一个月。Kimi K3 Max 1476.29 守在第 15,对手机端能直接调用的国产模型而言,已经是国际赛场的最高段位。

️ ② 视觉榜:Anthropic 继续横扫,国产卡 6

视觉榜 ② 分量级缩水到 1300 档,但排名格局没变:Fable 5 1330.51、Opus 5 (High) 1327.31、Opus 4.7 1316.41 拿下前三,国产依然只有 Qwen3.8 Max 一根独苗在第 6(1314.65)。Gemini 3.x Flash 系列从第 8 开始垫进前十,整体说明视觉领域闭源模型还是占绝对优势。

③ 网页开发榜:Kimi K3 杀到第 2,国产首次挤进前 3

WebDev 榜 ③ 看的是模型能不能照要求把 HTML+CSS+JS 一口气编出来,分数飞到 1600 档。这里出现了今天最值得说的一件事:Kimi K3 Max 以 1673.94 排在第 2,距榜首 Claude Opus 5 (Max) 1691.53 只差 17.59 ELO,领先所有其他选手。Qwen3.8 Max 1666.72 拿下第 3,前 3 里两席国产,这在 LMArena 历史上相当罕见。GLM 5.2 Max、DeepSeek V4 Pro High 也守住第 9、第 10 的位置。换句话说,写前端这件事,国产已经能跟海外顶配掰手腕。

④ Agent Arena:GPT 5.6 Sol 卡第 5,Kimi 守住第 4

智能体榜 ④ 用的是 IPS 分数,前三被 Claude 三连(Opus 5 (High) 0.1229、Opus 5 (Max) 0.1204、Fable 5 (High) 0.1163),Kimi K3 (Max) 以 0.1042 卡在第 4——仍然是 IPS 评分下唯一闯进前 5 的国产模型。GPT 5.6 Sol (xHigh) 0.0997 位列第 5,是 OpenAI 8 月 6 日新推的旗舰版本,不少粉丝一直在问它什么时候上榜,今天第一次在 LMArena Agent 榜有了正式名次。

⑤ 公司实力榜:按厂商聚合,国产厂合计 4 家进前 9

榜单 ⑤ 是把文本总榜 Top 30 按组织聚合,取各家最优模型的 ELO 排名。Anthropic 凭 9 个模型入围、总榜前 3 全包,稳坐公司榜 ①;Alibaba 凭 Qwen3.8 Max 列第 2,Meta 第 3,Google 第 4(7 个 Flash/Pro 上榜)。国产这边 Moonshot(月之暗面)凭 Kimi K3 Max 列第 5、Baidu(ERNIE 5.1)第 7、Zhipu(GLM)凭 GLM 5.2 Max 第 8、Xiaomi(Mimo V2.5 Pro)第 9。前 9 名里国产占 4 家,比去年同期翻了一倍。


模型编号含义速查

榜单名称一长串,直接告诉你怎么读:

记住一句话:品牌名 + 代次 + 强度档 = 你看到的完整名称。对到表格里看分高不高,再回到原始文档看它干啥用,比直接被版本号唬住省事得多。


以上就是今天的 LMArena 专场。三榜变五榜、分数从 ELO 到 IPS,理解清楚这套机制再看每日报表心里就有底了。下一期我们继续拆 OpenCompass 的子项结构,搞清楚它们跟 LMArena 的口径差异。

明天同一时间,继续追踪 AI 最强战力。

关注「AI全球模型排行」,每个工作日一档模型变化速报。

展开阅读全文

更新时间:2026-08-21

标签:科技   模型   日报   分数   视觉   版本号   后缀   文本   系列   主线   战力   守住

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top