The Total Score · 总榜评测体系
总榜是怎么算出来的
市面上的模型榜单,绝大多数是一张榜、一个数:把某一家机构的某一个 benchmark 拿来排个序,好坏全压在一个来源上。新智元 ASI 坐标不这么做 —— 总榜分数是一套三层结构的产物:先把每个模型在 29 个二级指标上的原始成绩归一化,再按设计权重汇成七个维度,最后合成一个 0–100 的总分。每一层都可以被读者自己验算:点开榜上任何一行,就能看见这个模型的七维画像、数据完整度,以及每一分是从哪个指标来的。
29
二级指标
LMArena / 致知 llm2014 / MathArena / Terminal-Bench / Mercor APEX / SWE-bench / τ³-bench / Vals.ai / Scale HLE · MCP Atlas / Context Arena / OpenRouter / GitHub 等公开源,外加 codex × Grok 协采通道(BrowseComp / IFBench / SuperCLUE 厂商自报)
→
7
评价维度
智能 12 · 推理 15 · 知识 14 · 编码 14 · Agent 15 · 生态 20 · 经济 10,加总 100%
→
1
总分与 Tier
0–100 总分 + S/A/B/C/D 五档;同一份七维数据换一套权重就是场景子榜
前沿锚定归一化(V1.4 起)每个指标以当期最强者为 100 的绝对刻度打分:Elo 换算成对前沿的期望得分(差 30 Elo ≈ 92 分),benchmark 按对前沿的完成度。不再拿队列里最弱的模型当 0 分锚点 —— 弱旅进出榜单不会抖动强者的分数,几十分 Elo 的采样噪声也不会被拉成 0–100 的假差距。总分差 ≤ 0.5 视为并列,并列时按能力纯分定序(所以偶尔会看到总分略低的排在前面,那是能力裁决的结果)。
一个榜单 · 一把尺ASI 坐标只有一个总榜;编程 / 中文 / 性价比这些子榜不是另一张榜,是同一份七维数据换一套权重。每个指标的 100 分锚点是榜上当期最强者,归一化队列就是入榜模型本身 —— 不拿榜外的模型当锚点,否则榜上所有人都在跟一个看不见的对手比,读者无从验算。生态与效率两维看的是真实市场:API 采用(OpenRouter 周 token 量、托管商数)、厂商 SDK、各 provider 实测速度、混合价。
子榜 = 同一份数据换权重编程 / 中文 / 性价比 / Agent / 长文本 / 新模型,不是另跑一套评测,是把同一份七维画像按场景重新加权 —— 所以子榜和总榜永远自洽。
证据从哪来 · 三条通道① 自动源:官方榜与第三方统一实测(LMArena、MathArena、Terminal-Bench、Mercor APEX、swebench.com、taubench.com 的 τ³-Banking、Vals.ai 四张榜、Scale 的 HLE 与 MCP Atlas、Context Arena、致知、OpenRouter、models.dev、GitHub),每周整份重采;② 协采:没有干净接口、或没有第三方统一榜的指标(HLE 补缺、SuperCLUE、BrowseComp、IFBench)由 codex 与 Grok 各自联网去找,同一个数两家一致才入库,只有一家找到就去它给的链接上核验、核验不过权重折半,两家分歧进待核清单不入库,artificialanalysis.ai 与聚合站的引用一律作废;③ 厂商自报只在没有第三方实测时用,页面上标「自报」。自动源哪天有了数,直接盖掉协采值。
覆盖门控:全榜同一把尺一个指标在榜内覆盖不足(少于 5 个模型、且不到 40%;本期队列 41 个模型)就只展示不计分,避免「只有两三个模型有数」的指标决定所有人的名次。BrowseComp / IFBench 这类靠厂商自报的指标,厂商不报就是不报 —— 覆盖不够时它的权重回退给同维其它指标,不拿 0 顶替。
排名之外还有一张脸总分只是入口。每个模型都公示七维画像、数据完整度与证据来源结构。四条不给排名:可得完整度 <15%、缺 3 个及以上维度、能力证据覆盖 <25%、能力分 >90% 来自单一数据源 —— 最后两条是 2026-08-31 体检加的:只有一条 Arena Elo 的模型不该和用了五个源的模型同榜排名。
本期七个维度中 7 个有数据在算,0 个待接入;29 个二级指标里 29 个有数。缺席的维度不删不藏 —— 权重按「市场证据缺多少就回退多少到能力分」处理。
抛开具体任务,这个模型的底子有多好?人类更愿意跟谁说话?
怎么测LMArena 文本竞技场总榜 Elo(3%)+ 高难提示 Elo(2%),配 HLE 3%(Scale 官方 text-only 榜自动采,榜上没有的前沿模型由 codex × Grok 协采厂商自报补)+ MMLU-Pro 2%(Vals.ai 第三方实测,10 选项抗猜测)+ IFBench 2%(Ai2 精确指令遵循,协采厂商自报)。
关键约束人类偏好是「谁更好用」最直接的一张票,但它奖励讨喜的表达方式,所以只给 6% 实弹权重(V1.9 起 = 总榜 4 + 高难提示 2,此前是 5+3),硬难度交给 D2 推理。投票样本 < 3000 的模型该项权重折半。 V1.9(2026-09-01)补 MMLU-Pro:人类投票测「谁更好用」、HLE 测「最难的题」,中间那格「知识底子厚不厚」原来是空的,而且 HLE 对中腰部模型普遍个位数、区分不动。 V1.13(2026-09-03)补 IFBench:Arena 测讨喜、HLE 测最难、MMLU-Pro 测底子,「说了要照办」这一格原来没人测;权重从 Arena 总榜(4→3)与 MMLU-Pro(3→2)各匀 1。厂商普遍不自报这一项,覆盖不够时按门控规则回退,不补 0。
本期在算 · 5/5 指标有数阶段一 · 公开数据自动化
- LMArena 文本竞技场 Elo(overall, style control)3%41/41
- Humanity's Last Exam3%21/41 · 协采 11 · 自报 11
- LMArena 高难提示 Elo2%41/41
- MMLU-Pro(Vals.ai 第三方实测)2%30/41
- IFBench 精确指令遵循(Ai2,58 条域外可验证约束)2%9/41 · 协采 9
给一道没见过的难题,模型能不能真的想明白?
怎么测MathArena arXiv 研究数学月榜 7% + 当年 AIME 4% + GPQA-Diamond 4%(Vals.ai 第三方实测)。
关键约束竞赛数学必须用当年新题 —— 往年 AIME 已进几乎所有模型的训练集,用旧题等于测记忆力。AIME 对前沿已近饱和(普遍 90+),真正拉开差距的是月更、抗污染的 arXiv 研究数学榜(当期 47–87%)。
本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
- MathArena 研究数学月榜(arXiv 新题)7%10/41
- AIME(当年新题,MathArena 第三方实测)4%11/41
- GPQA Diamond4%29/41
在中文里它到底行不行?—— 这是新智元榜和所有英文榜的分界线。
怎么测致知 llm2014 中文逻辑月榜 8% + LMArena 中文类目 Elo 3% + SuperCLUE 月度客观测评 3%(协采)。
关键约束2026-08-31 从原 D1 里独立成维(原来中文只是 D1 下的 3%)。中文不是「英文能力翻译一下就有」,把它压在综合维里等于不测。llm2014 题库不公开、月更,是当前最抗污染的中文源;同一底座带/不带思考档位会出两行,按指标方向取最优。
本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
- 致知 llm2014 逻辑月榜(极限分数)8%12/41
- LMArena 中文类目 Elo3%41/41
- SuperCLUE 月度客观测评总分3%5/41 · 协采 5
给它一个真实仓库里的 issue,它能不能改对?
怎么测SWE-bench Verified 4% + Mercor APEX-SWE 3% + LiveCodeBench 3%(Vals.ai)+ τ³-bench(τ³-Banking) pass^1 2% + LMArena WebDev 2%。
关键约束SWE-bench 只认 Verified 500 题子集,且必须连 scaffold 一起记 —— 同一模型换 Agent 框架成绩能差 15 分。V1.7(2026-08-31)起这一维的四个指标全部有自动源:SWE-bench 走 swebench.com 内嵌全表 + Vals 第三方实测(新模型靠后者),APEX-SWE 读全量 JSON(44 条),τ³-Banking(V1.7 接入时叫 τ²,同一张榜)走官方榜 banking_knowledge pass^1,不再是「只有 WebDev 在计分」。 V1.9(2026-09-01)补 LiveCodeBench:前四个指标全是「带 scaffold 的真实仓库任务」,裸算法能力没人测;且它们对中腰部模型覆盖太薄(最广的 SWE-bench 也只有 22/29),LCB 覆盖 137 个底座。
本期在算 · 5/5 指标有数阶段一 · 公开数据自动化
- SWE-bench Verified 解决率4%31/41
- Mercor APEX-SWE(真实软件工程)3%14/41
- τ³-bench · τ³-Banking pass^1(τ-knowledge,banking_knowledge v1.0.1)2%17/41
- LMArena WebDev 竞技场 Elo2%29/41
- LiveCodeBench(Vals.ai 第三方实测)3%27/41
不是「会不会写代码」,是「能不能独立把一件事从头做完」。
怎么测Terminal-Bench 4.0 官方榜 4% + Mercor APEX-Agents 4% + Terminal-Bench 2(Vals 复测)2% + MCP Atlas(Scale)2% + BrowseComp(厂商自报,协采)2% + LMArena Agent 竞技场 1%。
关键约束Agent 成绩必须连 scaffold 一起记,同模型多 scaffold 取最高。Terminal-Bench 版本钉死在当期 4.0(跨版本不可比 —— 2.1 的 83.8% 在 4.0 只值 51.8%),官方升版要清旧值全量重采,代码里有版本核对闸门,对不上直接报错而不是混着算。τ 系列取 pass^1 不取 pass^k —— 后者允许重试,掩盖稳定性差异。 V1.9(2026-09-01)补 Terminal-Bench 2(Vals 复测,3%):官方 4.0 榜只测到前沿那几个(当期 9/51),把 D5 的大头压在它一家身上,对四分之三的模型是空的。两条线各自归一化、各自计分,绝不把 2 与 4.0 的分数混进同一个指标。 V1.13(2026-09-03)补 MCP Atlas 与 BrowseComp:前者是「工具接口给你了能不能用对」(Scale 官方榜,30 行命中 21),后者是「一次搜不到的东西能不能磨出来」(无统一第三方榜,协采厂商自报、单 agent 口径);四个老指标各匀 1(TB 5→4、APEX 5→4、Vals TB2 3→2、Arena Agent 2→1)。
本期在算 · 6/6 指标有数阶段一 · 公开数据自动化
- Terminal-Bench 4.04%9/41
- Mercor APEX-Agents(专业长程任务)4%20/41
- LMArena Agent 竞技场得分1%23/41
- Terminal-Bench 2(Vals.ai 复测)2%17/41
- MCP Atlas(Scale · 多工具 MCP 任务)2%19/41
- BrowseComp(OpenAI,深网检索 1266 题)2%19/41 · 协采 19 · 自报 17
不看厂商宣传,看开发者的钱和手投给了谁。
怎么测OpenRouter 周 token 用量 7% + 托管商家数 3% + 厂商官方 SDK Star 10%。
关键约束计数类一律先取 log10 再归一化;口径用「近 30 日增量」而不是累计量,否则榜单会系统性偏向发布更久的老模型。三个指标都是「开发者真金白银的投票」:token 用量是钱、托管商数是供给、SDK Star 是手。
本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
- 厂商官方 SDK / Cookbook GitHub Star10%41/41
- OpenRouter 周 token 用量(rankings 周榜 Top 20)7%5/41
- OpenRouter 托管商数量3%31/41
同样的活,谁干得又快又便宜?
怎么测混合价 =(3×输入价 + 1×输出价)÷4 为主轴 5%,配 TPS 2 / 首字延迟 1 / 实测有效上下文 2。
关键约束速度数据必须标注 provider —— 同一个模型在不同托管商上 TPS 能差 5 倍,没有 provider 标注的速度数据不入库。上下文一栏用实测有效长度,不用厂商宣称的窗口大小。V1.7 起 TPS / TTFT 从 OpenRouter endpoints 自动采(取厂商第一方 API 那条线);有效上下文 V1.11 起走 Context Arena 自动源(MRCR 分档实测,口径仍是「得分 ≥0.85 的最大长度」)—— 此前挂在协采上永远拿不到:RULER 官方表覆盖不到榜上这批模型。
本期在算 · 4/4 指标有数阶段一 · 公开数据自动化
- 混合价 (3×输入 + 1×输出) ÷ 45%33/41
- 实测有效上下文长度(Context Arena · MRCR)2%21/41
- 输出速度 TPS2%27/41
- 首 token 延迟 TTFT1%27/41
七维权重(唯一权威 · 和为 100%)
智能12%
推理15%
知识14%
编码14%
Agent15%
生态20%
经济10%
归一化(四型 · 前沿锚定)
A 有界分数:100×(x−基线)÷(frontier−基线),基线=指标绝对零点(GPQA 25),不再用队列 P10
B 长尾计数(下载量/Star):100×log10(1+x)÷log10(1+frontier),0 是天然地板
C 越低越好(价格/延迟):对数后反向 min-max(唯一队列相对型——量级差是真实信息)
D Elo:200×对前沿期望得分,前沿=100,差 30 Elo≈92 分
缺失数据怎么处理
① 绝不补 0、绝不补均值 —— 那是错误信息,不是保守信息
② 覆盖门控 —— 榜内覆盖不足的指标只展示不计分,全榜同一把尺
③ 市场侧(生态 / 经济)证据缺多少,就有多少权重回退到能力分,不让残存指标放大代表
④ 主榜资格四道闸门(可得完整度 <15%、缺 3 个及以上维度、能力证据覆盖 <25%、能力分 >90% 来自单一数据源)任一不达标 → 只出分不排名,进「数据不足」区
数据完整度逐模型公示 —— 公示不是示弱,是公信力的来源。
三条铁律
① 合成指数与其成分 benchmark 二选一(AA Index 不计分,仅交叉校验)
② 单一数据源全体系上限 15%(当期最高 openrouter 18%,openrouter 已登记例外)
③ 删除已饱和 benchmark(HumanEval / MBPP / 原版 MMLU)
分档与榜单范围
Tier 分档:S ≥85 · A ≥72 · B ≥58 · C ≥40 · D。零点几分的差距没有方法论意义,跨档才是新闻。榜单范围:一个总榜,子榜只是同一份数据换权重;能力纯分 = 维度 1–5 合成(70% 重归一化为 100),是坐标图的纵轴。
快照 2026-09-03 · 七维算法 v1.13 · 周变动对照 2026-09-02
数据源与更新节奏(本轮采集实况)
采集于 2026-09-03 · LMArena 上游榜单快照 2026-08-27(上游隔几天才刷一次,不是我们没跑) · 每周一 02:20 采、周二 09:20 补采没成的源、周三 10:20 出榜 · 本轮证据 1190 条:新采 1088、沿用上一轮 30(最久 8 轮)、协采点证据 72
- Scale · HLE text-only + MCP Atlas90 行 · 16sHLE text-only 60 行(前沿新模型上榜滞后由协采补)+ MCP Atlas 30 行,都带 ±CI
- LMArena沿用 09-02 那轮 · 1334 行官方 HuggingFace 数据集 · 人类偏好 Elo 五张榜
- OpenRouter 价格沿用 09-02 那轮 · 394 行400 个模型的输入 / 输出价 → 混合价
- OpenRouter 托管商 + 速度沿用 09-02 那轮 · 36 行每个模型有几家在供 · 各 provider 的 p50 吞吐与首字延迟(取厂商第一方 API 那条线)
- OpenRouter 周榜沿用 09-02 那轮 · 17 行本周 Top 20 模型的 token 用量 → 采用度
- GitHub · 厂商 SDK沿用 09-02 那轮 · 72 行用厂商官方 SDK 的 Star 当开发者投入的代理指标
- SWE-bench沿用 09-02 那轮 · 221 行Verified 500 题官方榜(上游冻结在 2025-12)
- 致知 llm2014沿用 09-02 那轮 · 43 行逻辑推理月榜 · 每月换题,抗训练污染
- Mercor APEX沿用 09-02 那轮 · 87 行真实软件工程 / 长程 Agent 任务 · 页内嵌全量 JSON(Agents 57 / SWE 44 条)
- Terminal-Bench 4.0沿用 09-02 那轮 · 10 行官方榜 · 多 scaffold 取最高,版本核对闸门
- MathArena沿用 09-02 那轮 · 48 行当年 AIME + arXiv 研究数学月榜 · ETH SRI 第三方实测
- τ³-bench 官方榜沿用 09-02 那轮 · 27 行taubench.com · τ³-Banking(τ-knowledge)pass^1,提交文件字段仍是 tau2_bench_version 1.0.1
- Vals.ai沿用 09-02 那轮 · 483 行GPQA / MMLU-Pro / LiveCodeBench / Terminal-Bench 2 第三方统一实测(SWE-bench 那张并进 SWE-bench 行)
- Context Arena · 长上下文实测沿用 09-02 那轮 · 105 行MRCR 8 针检索按 context 长度分档 → 得分 ≥0.85 的最大长度 = 实测有效上下文
- models.dev · 价格第二源沿用 09-02 那轮 · 263 行厂商第一方牌价目录 · 只补 OpenRouter 缺的格子,重叠部分做差价核对
- 协采 · codex × Grok28 行缺口 82 · 入库 28(两家一致 16 / 单家核验 3 / 单家未核验 6)· 待核 0 · 没找到 54 · codex × grok
每个源单独重试、单独失败:一个源挂了不阻断算分,缺的指标按「覆盖门控 + 权重回退」处理,绝不补值。上表就是本轮采集的原始结果 —— 哪天塌了,页面上直接看得见。