新智元 -- 周 · 距重排 --:--:-- 关于我们
ASI 坐标今日看板总榜ASI 指数奇点坐标
LIVE · 数据快照 2026-09-03 · 算法 v1.13

新智元 ASI 坐标系

总榜 = 新智元七维评测体系加权总分 · 子榜 = 同一份七维数据按场景重加权 · 每周三 10:20 重排

本周 Arena 新增 32,606 观测源 15 · 自动指标 26 方法可验算 · 数据完整度逐模型公示
榜首 · CHAMPION
claude-opus-5
89.2S 档 · anthropic
第二 · RUNNER-UP
gpt-5.6-sol-xhigh
89.0S 档 · openai
第三 · THIRD
claude-fable-5
86.2S 档 · anthropic
Today's Board · 新模型雷达

ASI 坐标系今日看板近 7 天新上线

09.052026 · 周六 · 09:17 更新

近 7 天海外实验室新上线的模型与新版本 · 七个轴 = 坐标系 D1–D7 同一把尺 · 都跟同一条基准线

粗实线 = 已采到分 / 预估曲线细虚线 = 同厂现役最强的实测(只画在下面各自的卡片里)灰线 = 基准线外环 100 = 各维前沿目录源 × 公众号报道交叉验证过才上图总榜每周三重排

基准线总榜 30 个模型每一维取中位数,基准总分 79.4 —— 每张能力图的灰线都是这一条,所以几张图能横着比:智能 89.5 · 推理 93.1 · 知识 85.6 · 编码 77.0 · Agent 70.4 · 生态 84.4 · 经济 51.2

20406080智能D1 · 权重 12推理D2 · 权重 15知识D3 · 权重 14编码D4 · 权重 14AgentD5 · 权重 15生态D6 · 权重 20经济D7 · 权重 10
  • XINZHIYUAN · ASI COORDINATES111GPT-6 Astraopenai · 上线 2026-09-03 · 预估曲线(底子 gpt-5-6-sol-xhigh)93.1综合分 · 4 维走强 / 2 维走弱
  • XINZHIYUAN · ASI COORDINATES222GPT-6 Astra Proopenai · 上线 2026-09-03 · 预估曲线(底子 gpt-5-6-sol-xhigh)85.5综合分 · 4 维走强 / 2 维走弱
  • XINZHIYUAN · ASI COORDINATES333Claude Fable 5.1anthropic · 上线 2026-08-31 · 预估曲线(底子 claude-fable-5)83.5综合分 · 4 维走强 / 1 维走弱
  • XINZHIYUAN · ASI COORDINATES444Gemini 3.8 Flashgoogle · 上线 2026-09-02 · 预估曲线(底子 gemini-3-7-flash-high)80.2综合分 · 5 维走强 / 0 维走弱
  • XINZHIYUAN · ASI COORDINATES555Muse Spark 1.3meta · 上线 2026-09-02 · 预估曲线(底子 muse-spark)77.4综合分 · 4 维走强 / 0 维走弱
近 7 天新模型5
已入榜 / 待入榜0/ 5
公众号报道37篇 · 9 家
01
GPT-6 Astra
openai · 新模型待入榜 · 09-07 周一采集
OpenAI 新旗舰,能自己操作电脑干活上线 09-03 · 输出 $50/M · 上下文 1050000 · 预估 4 维走强 · 2 维走弱
XINZHIYUAN · ASI COORDINATES111
93.1综合分金牌 · 第 1 名
上线 2026-09-03(2 天前) · OpenRouter 09-05 上架 · $10 / $50 每百万 token(输入 / 输出) · 上下文 1050K
OpenRouter 上架 09-05报道 13 篇 · 7 家官方公告 09-04交叉验证 ✓ 3 路
OpenAI 新旗舰,主打长周期的分析、软件工程和深度研究,能自己操作电脑和浏览器干活。ARC-AGI-3 拿 99.9%。今天刚上 OpenRouter,输入每百万 10 美元。坐标系还没采到分,同厂现役最高总榜第 2。
预估依据 · 相对 gpt-5-6-sol-xhigh 每维怎么调的
  • 智能+8ARC-AGI-3得99.9%
  • 推理+2FrontierMath T4 97.6%
  • 编码+3官方列软件工程为强项
  • Agent+8操作电脑浏览器+异步工具调用
  • 生态-3LMArena未开测
  • 经济-10输入$10/输出$50每百万

预估只画在图上,综合分里的「能力」项用的仍是 gpt-5-6-sol-xhigh 的实测总分 —— 模型不给自己打分。

七维 · 预估曲线智能推理知识编码Agent生态经济粗实线 = GPT-6 Astra 预估 · 细虚线 = 同厂现役最强 gpt-5-6-sol-xhigh 实测 · 灰线 = 基准(总榜 30 个模型每维中位)
综合分构成 · 权重 50/25/15/10
能力95同厂现役最强 gpt-5-6-sol-xhigh 总分 89.0 · 总榜第 2 / 30
关注度1007 家 · 13 篇 · 阅读 630,896
可用度90官方公告 + OpenRouter 上架 + 有价
新鲜度71上线 2 天
02
GPT-6 Astra Pro
openai · 新模型待入榜 · 09-07 周一采集
GPT-6 Astra 同款,推理开到 pro 档上线 09-03 · 输出 $50/M · 上下文 1050000 · 预估 4 维走强 · 2 维走弱
XINZHIYUAN · ASI COORDINATES222
85.5综合分银牌 · 第 2 名
上线 2026-09-03(2 天前) · OpenRouter 09-05 上架 · $10 / $50 每百万 token(输入 / 输出) · 上下文 1050K
OpenRouter 上架 09-05报道 3 篇 · 3 家交叉验证 ✓ 2 路
和 GPT-6 Astra 是同一个模型,只是推理模式设成 pro,复杂任务答得更好。只对 ChatGPT Pro 和企业订阅用户开放,OpenRouter 今天也上了,价格同 Astra。坐标系还没采到分,同厂现役最高总榜第 2。
预估依据 · 相对 gpt-5-6-sol-xhigh 每维怎么调的
  • 智能+9同Astra底模+pro档更高质量
  • 推理+2pro档主打复杂任务更高质量
  • 编码+4同底模型pro档,软件工程强项
  • Agent+8同Astra,操作电脑+异步工具调用
  • 生态-7仅ChatGPT Pro和企业订阅可用
  • 经济-10输入$10/输出$50每百万

预估只画在图上,综合分里的「能力」项用的仍是 gpt-5-6-sol-xhigh 的实测总分 —— 模型不给自己打分。

七维 · 预估曲线智能推理知识编码Agent生态经济粗实线 = GPT-6 Astra Pro 预估 · 细虚线 = 同厂现役最强 gpt-5-6-sol-xhigh 实测 · 灰线 = 基准(总榜 30 个模型每维中位)
综合分构成 · 权重 50/25/15/10
能力95同厂现役最强 gpt-5-6-sol-xhigh 总分 89.0 · 总榜第 2 / 30
关注度703 家 · 3 篇 · 阅读 117,166
可用度90OpenRouter 上架 + 有价
新鲜度71上线 2 天
03
Claude Fable 5.1
anthropic · 新版本待入榜 · 09-07 周一采集
8 项公开基准第一,主攻长任务 Agent上线 08-31 · 输出 $50/M · 上下文 1000000 · 预估 4 维走强 · 1 维走弱
XINZHIYUAN · ASI COORDINATES333
83.5综合分铜牌 · 第 3 名
上线 2026-08-31(5 天前) · OpenRouter 09-02 上架 · $10 / $50 每百万 token(输入 / 输出) · 上下文 1000K
OpenRouter 上架 09-02报道 13 篇 · 7 家交叉验证 ✓ 2 路
Anthropic 新旗舰,强在编程和长周期 Agent 任务,Ramp 实测连跑 38 小时。缓存读取降价 75%,但开发者吐槽烧 Token 快。已上 OpenRouter。坐标系还没采到分,前代总榜第 3。
预估依据 · 相对 claude-fable-5 每维怎么调的
  • 智能+48项公开基准全第一
  • 编码+6官方称agentic coding提升最大
  • Agent+6TerminalBench4.0 55.8%
  • 生态-2已上OpenRouter未上LMArena
  • 经济+2缓存读降75%典型任务省25%

预估只画在图上,综合分里的「能力」项用的仍是 claude-fable-5 的实测总分 —— 模型不给自己打分。

七维 · 预估曲线智能推理知识编码Agent生态经济粗实线 = Claude Fable 5.1 预估 · 细虚线 = 前代 claude-fable-5 实测 · 灰线 = 基准(总榜 30 个模型每维中位)
综合分构成 · 权重 50/25/15/10
能力85前代 claude-fable-5 总分 86.2 · 总榜第 5 / 30
关注度997 家 · 13 篇 · 阅读 343,083
可用度90OpenRouter 上架 + 有价
新鲜度29上线 5 天
04
Gemini 3.8 Flash
google · 新版本待入榜 · 09-07 周一采集
距 3.7 Flash 仅 3 周,编码大涨上线 09-02 · 输出 $3.75/M · 上下文 1048576 · 预估 5 维走强 · 0 维走弱
XINZHIYUAN · ASI COORDINATES444
80.2综合分综合分排名 · 第 4 名
上线 2026-09-02(3 天前) · OpenRouter 09-02 上架 · $0.75 / $3.75 每百万 token(输入 / 输出) · 上下文 1048K
OpenRouter 上架 09-02报道 6 篇 · 4 家官方公告 09-02含变体 Gemini 3.8 Flash Cyber交叉验证 ✓ 3 路
谷歌的低价快模型,编码和 Agent 比 3.7 Flash 强,LMArena Agent 榜第 14。已上线,价格没涨,输入每百万 0.75 美元。另有网安版 Cyber,只给认证防守方用。坐标系还没采到分,前代总榜第 6。
预估依据 · 相对 gemini-3-7-flash-high 每维怎么调的
  • 智能+2官方称最智能Flash
  • 推理+1官方称多步推理有所提升
  • 编码+6报道称编码大幅提升
  • Agent+10LMArena Agent榜第14名
  • 经济+1定价与3.7 Flash一致

预估只画在图上,综合分里的「能力」项用的仍是 gemini-3-7-flash-high 的实测总分 —— 模型不给自己打分。

七维 · 预估曲线智能推理知识编码Agent生态经济粗实线 = Gemini 3.8 Flash 预估 · 细虚线 = 前代 gemini-3-7-flash-high 实测 · 灰线 = 基准(总榜 30 个模型每维中位)
综合分构成 · 权重 50/25/15/10
能力82前代 gemini-3-7-flash-high 总分 84.7 · 总榜第 6 / 30
关注度804 家 · 6 篇 · 阅读 235,339
可用度90官方公告 + OpenRouter 上架 + 有价
新鲜度57上线 3 天
05
Muse Spark 1.3
meta · 新版本待入榜 · 09-07 周一采集
Meta 开源新版,Token 比 1.2 省 25%上线 09-02 · 输出 $4.25/M · 上下文 1048576 · 预估 4 维走强 · 0 维走弱
XINZHIYUAN · ASI COORDINATES555
77.4综合分综合分排名 · 第 5 名
上线 2026-09-02(3 天前) · OpenRouter 09-03 上架 · $1.25 / $4.25 每百万 token(输入 / 输出) · 上下文 1048K
OpenRouter 上架 09-03报道 2 篇 · 2 家交叉验证 ✓ 2 路
Meta 的开源多模态模型新版,主打编码和长周期 Agent。官方称比 1.2 少约 20% 工具调用、25% Token。已上 OpenRouter,输入每百万 1.25 美元。坐标系还没采到分,前代总榜第 5。
预估依据 · 相对 muse-spark 每维怎么调的
  • 智能+6Max版AA 62分追平Fable 5
  • 编码+7报道称Coding提升最大
  • Agent+6Agent提升最大,工具调用少20%
  • 经济+5输出$4.25,Token比1.2省25%

预估只画在图上,综合分里的「能力」项用的仍是 muse-spark 的实测总分 —— 模型不给自己打分。

七维 · 预估曲线智能推理知识编码Agent生态经济粗实线 = Muse Spark 1.3 预估 · 细虚线 = 前代 muse-spark 实测 · 灰线 = 基准(总榜 30 个模型每维中位)
综合分构成 · 权重 50/25/15/10
能力88前代 muse-spark 总分 86.3 · 总榜第 4 / 30
关注度562 家 · 2 篇 · 阅读 32,407
可用度90OpenRouter 上架 + 有价
新鲜度57上线 3 天
新模型综合分 · 怎么算能力 50(坐标系总分 → 同家族前代 → 同厂现役最强 → 基准,四路兜底不留空,再换算成总榜位次:0 = 榜尾,100 = 榜首) · 关注度 25(报道它的公众号家数 + 阅读量) · 可用度 15(已发布可调用 60:官方公告或 OpenRouter 任一 + OpenRouter 20 + 有价 10 + LMArena 开测 10) · 新鲜度 10(上线当天 100,第 7 天归 0);缺项权重回退给有数的分项,不补 0。分数只从抓到的数据算,模型不打分。能力用总榜位次不用原始总分,是因为主榜总分挤在一小段里,原始分拉不开差距、能力决定不了名次。权重是拍的初始值,每天记台账,模型入榜后回看排序对不对(台账刚开始记,还没有可回看的)。
目录源 OpenRouter 431 个模型 · LMArena 快照 12 份 · 模型库 74 行公众号 清博(GSData)9 家 · 09-04 ~ 09-05 · 68 篇 · 粗筛 18 篇坐标系快照 2026-09-03 · 算法 v1.13生成 2026-09-05 09:17:22
The Leaderboard · 总榜

新智元 ASI 坐标系 · 总榜

总榜 = 七维评测体系加权总分(智能 12 · 推理 15 · 知识 14 · 编码 14 · Agent 15 · 生态 20 · 经济 10)· 子榜 = 同一份七维数据按场景重加权 · 点击任意一行展开七维画像

快照2026-09-03 席位TOP 30 重排每周三 10:20
总榜 = 七维加权总分(智能12·推理15·知识14·编码14·Agent15·生态20·经济10)· 点击行展开七维画像
名次模型分数周变动本周 Arena 票可得完整度

ASI 坐标

CAPABILITY × VALUE · 核心视觉

纵轴是能力,横轴是性价比 —— 右上角那一片,才是真正值得掏钱的模型。点的大小 = 本周 Arena 票数量级。

02040608010060708090100甜点区 · 又强又便宜旗舰区 · 强但贵够用就好两头不占gemini-2.5-pro · 能力 62.4 · 性价比 18.8claude-sonnet-4-5-20250929 · 能力 62.6 · 性价比 12.1claude-opus-4-1-20250805 · 能力 64.5 · 性价比 0.0gemini-3.5-flash-lite · 能力 65.8 · 性价比 52.4gpt-5.1 · 能力 69.8 · 性价比 26.0grok-4.3 · 能力 75.4 · 性价比 47.7claude-opus-4-5-20251101 · 能力 75.5 · 性价比 17.0gemini-3-flash · 能力 76.2 · 性价比 57.8claude-sonnet-5-high · 能力 76.3 · 性价比 29.8claude-sonnet-4-6 · 能力 76.8 · 性价比 24.2gpt-5.6-luna-xhigh · 能力 77.6 · 性价比 100.0muse-spark-1.2 · 能力 78.1 · 性价比 44.8gpt-5.2 · 能力 79.4 · 性价比 29.8gemini-3.5-flash · 能力 79.8 · 性价比 36.0grok-4.5 · 能力 79.9 · 性价比 38.2gemini-3.6-flash · 能力 80.0 · 性价比 54.1grok-4.20-beta-0309-reasoning · 能力 80.2 · 性价比 53.3gpt-5.4 · 能力 81.2 · 性价比 52.5gpt-5.6-terra-xhigh · 能力 82.2 · 性价比 33.3gpt-5.3-chat-latest · 能力 82.3 · 性价比 32.4gemini-3.1-pro-preview · 能力 83.2 · 性价比 34.2muse-spark-1.1 · 能力 83.8 · 性价比 51.1claude-opus-4-6 · 能力 84.4 · 性价比 24.0grok-4.6-high · 能力 85.0 · 性价比 43.4grok-4.20-multi-agent-beta-0309 · 能力 85.2 · 性价比 59.2claude-opus-4-8 · 能力 85.3 · 性价比 24.7gemini-3.7-flash-high · 能力 87.5 · 性价比 63.2claude-opus-4-7 · 能力 87.8 · 性价比 26.6gpt-5.2-chat-latest-20260210 · 能力 88.3 · 性价比 37.8gpt-5.5 · 能力 91.2 · 性价比 27.8gpt-5.6-sol-xhigh · 能力 93.0 · 性价比 45.4claude-fable-5 · 能力 94.1 · 性价比 23.1claude-opus-5 · 能力 96.8 · 性价比 33.6claude-opus-5claude-fable-5gpt-5.6-sol-xhighgpt-5.5gpt-5.2-chat-latest-2026claude-opus-4-7gemini-3.7-flash-highgrok-4.20-multi-agent-begrok-4.6-highmuse-spark-1.1gemini-3.1-pro-previewgpt-5.4性价比(能力分 ÷ 对数混合价,队列内缩放 0–100)→↑ 能力纯分(维度 1–5 合成 · 70% 重归一化为 100)

入榜模型 甜点区(能力与性价比双双高于中位) 虚线 = 当期中位线 缺价格或缺能力分的模型不入图(绝不补 0)

方法论

THE MEASURING ROD · 方法层

复杂留给方法论,简单留给读者。总分之下是可验算的三层体系 —— 黑箱请你相信结论,新智元请你验算过程。

The Total Score · 总榜评测体系

总榜是怎么算出来的

市面上的模型榜单,绝大多数是一张榜、一个数:把某一家机构的某一个 benchmark 拿来排个序,好坏全压在一个来源上。新智元 ASI 坐标不这么做 —— 总榜分数是一套三层结构的产物:先把每个模型在 29 个二级指标上的原始成绩归一化,再按设计权重汇成七个维度,最后合成一个 0–100 的总分。每一层都可以被读者自己验算:点开榜上任何一行,就能看见这个模型的七维画像、数据完整度,以及每一分是从哪个指标来的。

29
二级指标
LMArena / 致知 llm2014 / MathArena / Terminal-Bench / Mercor APEX / SWE-bench / τ³-bench / Vals.ai / Scale HLE · MCP Atlas / Context Arena / OpenRouter / GitHub 等公开源,外加 codex × Grok 协采通道(BrowseComp / IFBench / SuperCLUE 厂商自报)
7
评价维度
智能 12 · 推理 15 · 知识 14 · 编码 14 · Agent 15 · 生态 20 · 经济 10,加总 100%
1
总分与 Tier
0–100 总分 + S/A/B/C/D 五档;同一份七维数据换一套权重就是场景子榜
指标级证据加权 · 算法 v1.13 总分 = 能力分 × (70 + 缺失的市场权重) ÷ 100 + Σ(每个市场指标得分 × 它的设计权重) ÷ 100

关键在于每个二级指标只有它设计权重那么大的话语权 —— 一个 8% 的指标就是 8%,绝不因为同维度别的指标缺数据,就让它膨胀去冒充一个 20% 的维度。市场侧(生态 / 经济,设计合计 30%)证据缺多少,就有多少权重回退到这个模型自己的能力分,而不是补 0、也不是补均值。

前沿锚定归一化(V1.4 起)

每个指标以当期最强者为 100 的绝对刻度打分:Elo 换算成对前沿的期望得分(差 30 Elo ≈ 92 分),benchmark 按对前沿的完成度。不再拿队列里最弱的模型当 0 分锚点 —— 弱旅进出榜单不会抖动强者的分数,几十分 Elo 的采样噪声也不会被拉成 0–100 的假差距。总分差 ≤ 0.5 视为并列,并列时按能力纯分定序(所以偶尔会看到总分略低的排在前面,那是能力裁决的结果)。

一个榜单 · 一把尺

ASI 坐标只有一个总榜;编程 / 中文 / 性价比这些子榜不是另一张榜,是同一份七维数据换一套权重。每个指标的 100 分锚点是榜上当期最强者,归一化队列就是入榜模型本身 —— 不拿榜外的模型当锚点,否则榜上所有人都在跟一个看不见的对手比,读者无从验算。生态与效率两维看的是真实市场:API 采用(OpenRouter 周 token 量、托管商数)、厂商 SDK、各 provider 实测速度、混合价。

子榜 = 同一份数据换权重

编程 / 中文 / 性价比 / Agent / 长文本 / 新模型,不是另跑一套评测,是把同一份七维画像按场景重新加权 —— 所以子榜和总榜永远自洽。

证据从哪来 · 三条通道

自动源:官方榜与第三方统一实测(LMArena、MathArena、Terminal-Bench、Mercor APEX、swebench.com、taubench.com 的 τ³-Banking、Vals.ai 四张榜、Scale 的 HLE 与 MCP Atlas、Context Arena、致知、OpenRouter、models.dev、GitHub),每周整份重采;② 协采:没有干净接口、或没有第三方统一榜的指标(HLE 补缺、SuperCLUE、BrowseComp、IFBench)由 codex 与 Grok 各自联网去找,同一个数两家一致才入库,只有一家找到就去它给的链接上核验、核验不过权重折半,两家分歧进待核清单不入库,artificialanalysis.ai 与聚合站的引用一律作废;③ 厂商自报只在没有第三方实测时用,页面上标「自报」。自动源哪天有了数,直接盖掉协采值。

覆盖门控:全榜同一把尺

一个指标在榜内覆盖不足(少于 5 个模型、且不到 40%;本期队列 41 个模型)就只展示不计分,避免「只有两三个模型有数」的指标决定所有人的名次。BrowseComp / IFBench 这类靠厂商自报的指标,厂商不报就是不报 —— 覆盖不够时它的权重回退给同维其它指标,不拿 0 顶替。

排名之外还有一张脸

总分只是入口。每个模型都公示七维画像、数据完整度与证据来源结构。四条不给排名:可得完整度 <15%、缺 3 个及以上维度、能力证据覆盖 <25%、能力分 >90% 来自单一数据源 —— 最后两条是 2026-08-31 体检加的:只有一条 Arena Elo 的模型不该和用了五个源的模型同榜排名。

本期七个维度中 7 个有数据在算,0 个待接入;29 个二级指标里 29 个有数。缺席的维度不删不藏 —— 权重按「市场证据缺多少就回退多少到能力分」处理。

七个维度

THE SEVEN DIMENSIONS · 逐维拆解

下面是七维的全部七个。每一维给出核心问题、怎么测、关键约束,以及它下面每一个二级指标的权重、来源通道与当期覆盖 —— 协采与厂商自报的指标单独标出,没数据的也照列不藏。

智能Intelligence12%

抛开具体任务,这个模型的底子有多好?人类更愿意跟谁说话?

怎么测LMArena 文本竞技场总榜 Elo(3%)+ 高难提示 Elo(2%),配 HLE 3%(Scale 官方 text-only 榜自动采,榜上没有的前沿模型由 codex × Grok 协采厂商自报补)+ MMLU-Pro 2%(Vals.ai 第三方实测,10 选项抗猜测)+ IFBench 2%(Ai2 精确指令遵循,协采厂商自报)。

关键约束人类偏好是「谁更好用」最直接的一张票,但它奖励讨喜的表达方式,所以只给 6% 实弹权重(V1.9 起 = 总榜 4 + 高难提示 2,此前是 5+3),硬难度交给 D2 推理。投票样本 < 3000 的模型该项权重折半。 V1.9(2026-09-01)补 MMLU-Pro:人类投票测「谁更好用」、HLE 测「最难的题」,中间那格「知识底子厚不厚」原来是空的,而且 HLE 对中腰部模型普遍个位数、区分不动。 V1.13(2026-09-03)补 IFBench:Arena 测讨喜、HLE 测最难、MMLU-Pro 测底子,「说了要照办」这一格原来没人测;权重从 Arena 总榜(4→3)与 MMLU-Pro(3→2)各匀 1。厂商普遍不自报这一项,覆盖不够时按门控规则回退,不补 0。

本期在算 · 5/5 指标有数阶段一 · 公开数据自动化
  • LMArena 文本竞技场 Elo(overall, style control)3%41/41
  • Humanity's Last Exam3%21/41 · 协采 11 · 自报 11
  • LMArena 高难提示 Elo2%41/41
  • MMLU-Pro(Vals.ai 第三方实测)2%30/41
  • IFBench 精确指令遵循(Ai2,58 条域外可验证约束)2%9/41 · 协采 9
推理Reasoning15%

给一道没见过的难题,模型能不能真的想明白?

怎么测MathArena arXiv 研究数学月榜 7% + 当年 AIME 4% + GPQA-Diamond 4%(Vals.ai 第三方实测)。

关键约束竞赛数学必须用当年新题 —— 往年 AIME 已进几乎所有模型的训练集,用旧题等于测记忆力。AIME 对前沿已近饱和(普遍 90+),真正拉开差距的是月更、抗污染的 arXiv 研究数学榜(当期 47–87%)。

本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
  • MathArena 研究数学月榜(arXiv 新题)7%10/41
  • AIME(当年新题,MathArena 第三方实测)4%11/41
  • GPQA Diamond4%29/41
知识Knowledge14%

在中文里它到底行不行?—— 这是新智元榜和所有英文榜的分界线。

怎么测致知 llm2014 中文逻辑月榜 8% + LMArena 中文类目 Elo 3% + SuperCLUE 月度客观测评 3%(协采)。

关键约束2026-08-31 从原 D1 里独立成维(原来中文只是 D1 下的 3%)。中文不是「英文能力翻译一下就有」,把它压在综合维里等于不测。llm2014 题库不公开、月更,是当前最抗污染的中文源;同一底座带/不带思考档位会出两行,按指标方向取最优。

本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
  • 致知 llm2014 逻辑月榜(极限分数)8%12/41
  • LMArena 中文类目 Elo3%41/41
  • SuperCLUE 月度客观测评总分3%5/41 · 协采 5
编码Coding14%

给它一个真实仓库里的 issue,它能不能改对?

怎么测SWE-bench Verified 4% + Mercor APEX-SWE 3% + LiveCodeBench 3%(Vals.ai)+ τ³-bench(τ³-Banking) pass^1 2% + LMArena WebDev 2%。

关键约束SWE-bench 只认 Verified 500 题子集,且必须连 scaffold 一起记 —— 同一模型换 Agent 框架成绩能差 15 分。V1.7(2026-08-31)起这一维的四个指标全部有自动源:SWE-bench 走 swebench.com 内嵌全表 + Vals 第三方实测(新模型靠后者),APEX-SWE 读全量 JSON(44 条),τ³-Banking(V1.7 接入时叫 τ²,同一张榜)走官方榜 banking_knowledge pass^1,不再是「只有 WebDev 在计分」。 V1.9(2026-09-01)补 LiveCodeBench:前四个指标全是「带 scaffold 的真实仓库任务」,裸算法能力没人测;且它们对中腰部模型覆盖太薄(最广的 SWE-bench 也只有 22/29),LCB 覆盖 137 个底座。

本期在算 · 5/5 指标有数阶段一 · 公开数据自动化
  • SWE-bench Verified 解决率4%31/41
  • Mercor APEX-SWE(真实软件工程)3%14/41
  • τ³-bench · τ³-Banking pass^1(τ-knowledge,banking_knowledge v1.0.1)2%17/41
  • LMArena WebDev 竞技场 Elo2%29/41
  • LiveCodeBench(Vals.ai 第三方实测)3%27/41
AgentAgent15%

不是「会不会写代码」,是「能不能独立把一件事从头做完」。

怎么测Terminal-Bench 4.0 官方榜 4% + Mercor APEX-Agents 4% + Terminal-Bench 2(Vals 复测)2% + MCP Atlas(Scale)2% + BrowseComp(厂商自报,协采)2% + LMArena Agent 竞技场 1%。

关键约束Agent 成绩必须连 scaffold 一起记,同模型多 scaffold 取最高。Terminal-Bench 版本钉死在当期 4.0(跨版本不可比 —— 2.1 的 83.8% 在 4.0 只值 51.8%),官方升版要清旧值全量重采,代码里有版本核对闸门,对不上直接报错而不是混着算。τ 系列取 pass^1 不取 pass^k —— 后者允许重试,掩盖稳定性差异。 V1.9(2026-09-01)补 Terminal-Bench 2(Vals 复测,3%):官方 4.0 榜只测到前沿那几个(当期 9/51),把 D5 的大头压在它一家身上,对四分之三的模型是空的。两条线各自归一化、各自计分,绝不把 2 与 4.0 的分数混进同一个指标。 V1.13(2026-09-03)补 MCP Atlas 与 BrowseComp:前者是「工具接口给你了能不能用对」(Scale 官方榜,30 行命中 21),后者是「一次搜不到的东西能不能磨出来」(无统一第三方榜,协采厂商自报、单 agent 口径);四个老指标各匀 1(TB 5→4、APEX 5→4、Vals TB2 3→2、Arena Agent 2→1)。

本期在算 · 6/6 指标有数阶段一 · 公开数据自动化
  • Terminal-Bench 4.04%9/41
  • Mercor APEX-Agents(专业长程任务)4%20/41
  • LMArena Agent 竞技场得分1%23/41
  • Terminal-Bench 2(Vals.ai 复测)2%17/41
  • MCP Atlas(Scale · 多工具 MCP 任务)2%19/41
  • BrowseComp(OpenAI,深网检索 1266 题)2%19/41 · 协采 19 · 自报 17
生态Ecosystem20%

不看厂商宣传,看开发者的钱和手投给了谁。

怎么测OpenRouter 周 token 用量 7% + 托管商家数 3% + 厂商官方 SDK Star 10%。

关键约束计数类一律先取 log10 再归一化;口径用「近 30 日增量」而不是累计量,否则榜单会系统性偏向发布更久的老模型。三个指标都是「开发者真金白银的投票」:token 用量是钱、托管商数是供给、SDK Star 是手。

本期在算 · 3/3 指标有数阶段一 · 公开数据自动化
  • 厂商官方 SDK / Cookbook GitHub Star10%41/41
  • OpenRouter 周 token 用量(rankings 周榜 Top 20)7%5/41
  • OpenRouter 托管商数量3%31/41
经济Economy10%

同样的活,谁干得又快又便宜?

怎么测混合价 =(3×输入价 + 1×输出价)÷4 为主轴 5%,配 TPS 2 / 首字延迟 1 / 实测有效上下文 2。

关键约束速度数据必须标注 provider —— 同一个模型在不同托管商上 TPS 能差 5 倍,没有 provider 标注的速度数据不入库。上下文一栏用实测有效长度,不用厂商宣称的窗口大小。V1.7 起 TPS / TTFT 从 OpenRouter endpoints 自动采(取厂商第一方 API 那条线);有效上下文 V1.11 起走 Context Arena 自动源(MRCR 分档实测,口径仍是「得分 ≥0.85 的最大长度」)—— 此前挂在协采上永远拿不到:RULER 官方表覆盖不到榜上这批模型。

本期在算 · 4/4 指标有数阶段一 · 公开数据自动化
  • 混合价 (3×输入 + 1×输出) ÷ 45%33/41
  • 实测有效上下文长度(Context Arena · MRCR)2%21/41
  • 输出速度 TPS2%27/41
  • 首 token 延迟 TTFT1%27/41

算法细则

THE FINE PRINT · 可验算层

七维权重(唯一权威 · 和为 100%)

智能12%
推理15%
知识14%
编码14%
Agent15%
生态20%
经济10%

归一化(四型 · 前沿锚定)

A 有界分数:100×(x−基线)÷(frontier−基线),基线=指标绝对零点(GPQA 25),不再用队列 P10

B 长尾计数(下载量/Star):100×log10(1+x)÷log10(1+frontier),0 是天然地板

C 越低越好(价格/延迟):对数后反向 min-max(唯一队列相对型——量级差是真实信息)

D Elo:200×对前沿期望得分,前沿=100,差 30 Elo≈92 分

缺失数据怎么处理

绝不补 0、绝不补均值 —— 那是错误信息,不是保守信息

② 覆盖门控 —— 榜内覆盖不足的指标只展示不计分,全榜同一把尺

③ 市场侧(生态 / 经济)证据缺多少,就有多少权重回退到能力分,不让残存指标放大代表

④ 主榜资格四道闸门(可得完整度 <15%、缺 3 个及以上维度、能力证据覆盖 <25%、能力分 >90% 来自单一数据源)任一不达标 → 只出分不排名,进「数据不足」区

数据完整度逐模型公示 —— 公示不是示弱,是公信力的来源。

三条铁律

① 合成指数与其成分 benchmark 二选一(AA Index 不计分,仅交叉校验)

② 单一数据源全体系上限 15%(当期最高 openrouter 18%,openrouter 已登记例外)

③ 删除已饱和 benchmark(HumanEval / MBPP / 原版 MMLU)

分档与榜单范围

Tier 分档:S ≥85 · A ≥72 · B ≥58 · C ≥40 · D。零点几分的差距没有方法论意义,跨档才是新闻。榜单范围:一个总榜,子榜只是同一份数据换权重;能力纯分 = 维度 1–5 合成(70% 重归一化为 100),是坐标图的纵轴。

快照 2026-09-03 · 七维算法 v1.13 · 周变动对照 2026-09-02

数据源与更新节奏(本轮采集实况)

采集于 2026-09-03 · LMArena 上游榜单快照 2026-08-27(上游隔几天才刷一次,不是我们没跑) · 每周一 02:20 采、周二 09:20 补采没成的源、周三 10:20 出榜 · 本轮证据 1190 条:新采 1088、沿用上一轮 30(最久 8 轮)、协采点证据 72

  • Scale · HLE text-only + MCP Atlas90 行 · 16sHLE text-only 60 行(前沿新模型上榜滞后由协采补)+ MCP Atlas 30 行,都带 ±CI
  • LMArena沿用 09-02 那轮 · 1334 行官方 HuggingFace 数据集 · 人类偏好 Elo 五张榜
  • OpenRouter 价格沿用 09-02 那轮 · 394 行400 个模型的输入 / 输出价 → 混合价
  • OpenRouter 托管商 + 速度沿用 09-02 那轮 · 36 行每个模型有几家在供 · 各 provider 的 p50 吞吐与首字延迟(取厂商第一方 API 那条线)
  • OpenRouter 周榜沿用 09-02 那轮 · 17 行本周 Top 20 模型的 token 用量 → 采用度
  • GitHub · 厂商 SDK沿用 09-02 那轮 · 72 行用厂商官方 SDK 的 Star 当开发者投入的代理指标
  • SWE-bench沿用 09-02 那轮 · 221 行Verified 500 题官方榜(上游冻结在 2025-12)
  • 致知 llm2014沿用 09-02 那轮 · 43 行逻辑推理月榜 · 每月换题,抗训练污染
  • Mercor APEX沿用 09-02 那轮 · 87 行真实软件工程 / 长程 Agent 任务 · 页内嵌全量 JSON(Agents 57 / SWE 44 条)
  • Terminal-Bench 4.0沿用 09-02 那轮 · 10 行官方榜 · 多 scaffold 取最高,版本核对闸门
  • MathArena沿用 09-02 那轮 · 48 行当年 AIME + arXiv 研究数学月榜 · ETH SRI 第三方实测
  • τ³-bench 官方榜沿用 09-02 那轮 · 27 行taubench.com · τ³-Banking(τ-knowledge)pass^1,提交文件字段仍是 tau2_bench_version 1.0.1
  • Vals.ai沿用 09-02 那轮 · 483 行GPQA / MMLU-Pro / LiveCodeBench / Terminal-Bench 2 第三方统一实测(SWE-bench 那张并进 SWE-bench 行)
  • Context Arena · 长上下文实测沿用 09-02 那轮 · 105 行MRCR 8 针检索按 context 长度分档 → 得分 ≥0.85 的最大长度 = 实测有效上下文
  • models.dev · 价格第二源沿用 09-02 那轮 · 263 行厂商第一方牌价目录 · 只补 OpenRouter 缺的格子,重叠部分做差价核对
  • 协采 · codex × Grok28 行缺口 82 · 入库 28(两家一致 16 / 单家核验 3 / 单家未核验 6)· 待核 0 · 没找到 54 · codex × grok

每个源单独重试、单独失败:一个源挂了不阻断算分,缺的指标按「覆盖门控 + 权重回退」处理,绝不补值。上表就是本轮采集的原始结果 —— 哪天塌了,页面上直接看得见。

Months · The Clock

ASI指数·奇点坐标

日的编年,在这里刻成月的读数 —— 两把尺 × 一票之力,全部刻度在此

AI ERA · ASI 指数 · 每日校准 · 每月定格

人类文明的下一站,
我们一起见证

给智能一把尺,给未来一张图。ASI 指数综合七印十维,把秒与日的洪流,压缩成一个月度可比的文明刻度。

24H ↑2.8 置信度 91% 实时 79.712 临界信号 本周 +3
Α · 起点85 · 临界区Ω · 奇点