模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

独立交叉验证23 个正式可比模型8 类第三方来源

AI 大模型选择器先看你要做什么,再看谁更合适

先按任务给出能直接照着用的结论,再展开证据、成本与局限;新品观察不混入正式排名。

覆盖哪些模型与证据

本站把 GPT、Claude、Gemini、Grok、Meta、GLM、DeepSeek、Qwen、Kimi 和 MiniMax 放进同一张能力地图。目前有 23 个正式可比模型,另保留 11 个新品观察或历史基线资料项。

型号和价格由官方资料确认;强能力结论至少需要两个方法不同的独立来源互相支持。

默认综合建议

Astra 做工程闭环,Fable 5.1 交叉复核高难仓库与终端任务先评估 Astra;含糊需求、多文件规划和独立复核用 Fable 5.1。预算敏感且验收明确时,Sol 仍是成熟执行路线。

30 秒 · 三个问题

按你的实际用法选择

跨来源结论
1 怎么使用
2 做什么
3 最在意什么
最稳组合

Astra 做工程闭环,Fable 5.1 交叉复核

高难仓库与终端任务先评估 Astra;含糊需求、多文件规划和独立复核用 Fable 5.1。预算敏感且验收明确时,Sol 仍是成熟执行路线。

Astra / Fable 5.1 先从 high 开始;难题或返工代价高时可直接 xhigh/max。Fable 的 AA 中低档是估算,选择档位同时看 Cursor 实测。

使用渠道
Codex、Claude Code、Cursor 或模型 API
推理强度
Astra high;Fable 5.1 high/xhigh;高价值难题可用 max
付费方式
编程工具会员或 API 按量调用
主要限制
DeepSWE 中 Astra xhigh 与 Sol max 区间重叠;Fable 5.1 尚无同榜结果,模型复核不能代替测试。
证据
4 类来源 · 核验 2026-09-05

先说明我们怎么判断

我们如何判断

官方资料只负责确认名称、规格、价格与可用性;能力结论至少需要两个方法不同的第三方来源互相支持。模型、推理档位、代理框架和测试版本都会单独标注。 如果“相差 1 分”仍没有体感,可以查看 分差、任务成功率、费用与等待的同屏解释

四条分轨排行榜

按你关心的问题看排名

没有一个万能总榜。旗舰上限、日常实用、成本价值和专项能力分别回答不同问题;想自己挑选 2—4 个模型逐项核对,可以继续进入 多模型直接对比

不优先考虑成本 · 各厂商当前通用旗舰,已测单模型上限到哪里?

只比较版本明确、公开可用的通用旗舰最佳已测配置;最高得分不总在最高推理档。AA 估算和 Ultra 多代理不混入正式榜。

01
Fable 5.1Anthropic · 高难任务旗舰查看完整资料 →
AA v4.2 · 57 · max · 含安全回退

AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。

核验 2026-09-05
把握 中高
02
AstraOpenAI · 高难任务旗舰查看完整资料 →
AA v4.2 · 55 · max

AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。

核验 2026-09-05
把握 中高
03
Grok 4.6xAI · 低价前沿旗舰查看完整资料 →
AA v4.2 · 51 · high

AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。

核验 2026-09-05
把握 中高
04
Kimi K3Moonshot · 通用旗舰 · 新发布 · 开放权重查看完整资料 →
AA v4.2 · 50 · max

AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。

核验 2026-09-05
把握 中高
05
GLM-5.3Z.AI · 开放权重前沿旗舰 · 开放权重查看完整资料 →
AA v4.2 · 49 · max

AA v4.2 max 49、K3 max 50;仍属开放权重高端,不能把英文综合与代码结果外推成所有中文任务同档。

核验 2026-09-05
把握
06
Qwen 3.8 MaxAlibaba · 国产强第二梯队旗舰查看完整资料 →
AA v4.2 · 47 · 原页未标档位

AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。

核验 2026-09-05
把握 中高

AA 数字固定为 2026-09-05 核对的 v4.2 快照;旗舰榜排除估算,最佳已测档不一定是最高 effort。指数点不是 IQ 或成功率百分比。成本轨道不表示效果相同,专项轨道也不是通用排名。

普通用户先看这里

看懂这些词就够了

不需要会编程。后文遇到这些词时,可以按下面的简单意思理解。

模型与编程工具

模型像“大脑”;Codex、Claude Code、Cursor 像“工作台”。同一模型换工具,实际编程效果也会变。

推理强度

让同一模型多花多少步骤读、试、用工具和复查。越高通常越慢、越贵,也不保证每项任务都更好;Max 是单模型,Ultra 是多代理。

token、上下文与缓存

token 是计费和处理文字的小单位;上下文是一次能记住的内容量;缓存是重复内容少算一次钱。

API 与开放权重

API 是开发者按量调用模型的接口;开放权重表示模型文件可下载部署,不等于完全免费或没有许可限制。

统一测试环境

让不同模型使用尽量相同的提示、工具、时间和评分方法。这样比直接拼接各厂商自报分数更公平。

先回答最常见的问题

选模型前,先弄清这九件事

先看简短答案,需要核对分数、价格和来源时,再继续查看后面的专业部分。

只能买一个会员,应该怎么选?

先看常做任务与套餐实际包含的模型。Astra 适合工程、终端与复杂分析,Fable 5.1 值得试模糊多文件和复杂交付;但 Claude Pro 的 Fable 需额外点数,Max 也有共享周额度上限。日常任务不必为最高档付费,购买前核对官方权益。

按自己的用途选一次
会员和 API 有什么区别?

会员是 ChatGPT、Claude 等应用的套餐;API 是开发者按输入和输出量付费。两者的价格、额度、工具权限和数据条款不同,不能把每百万 token 价格当成会员费。

查看四种使用方式
为什么榜单第一不一定最适合我?

榜单只覆盖特定题目和测试环境。写作、完整应用、仓库修复、终端代理和中文任务需要的能力不同;接近误差范围的小差距也不值得强行分出唯一冠军。

查看分轨排行榜
编程效果是模型决定,还是工具决定?

两者共同决定。Codex、Claude Code、Cursor 等工具会提供不同的终端、检索、上下文管理和重试方式,同一模型换一个工作台,实际结果可能明显变化。

查看编程任务分榜
medium、high、xhigh、max 怎么选?

按型号和入口选:Astra、Fable 5.1 的 API 默认 high,Sol 默认 medium,Fable 在 Claude.ai 默认 medium。先用默认档,难题再比较 xhigh / max 的增益;最高档可能只略有提升却明显更贵。Ultra 或 Ultracode 是工作流,不是更高的裸模型档。

查看三型号全档、费用与限制
便宜 API 为什么不一定更省钱?

低单价模型如果更容易失败、输出更长或反复调用工具,任务总成本可能反而更高。成本轨道只提供低价候选,还要结合成功率、重试和人工审查判断。

估算一次 API 任务
GLM-5.3 Flash 分数很高,能直接替代 Sol 吗?

不能直接替代。AA v4.2 中 Flash 为 46,等于 Sol medium 的点估计,不是旧方法下的 Sol high;原创长程工程为 63%±4,比 Sol max 点估计低 10 个百分点。让强模型先写清计划和测试,再让 Flash max 执行可回滚支线;理解错就升级,不要无限重跑。

看高分与真实任务差距
Astra 和 Fable 5.1 相当于 Sol 的哪一档?

没有跨任务统一答案。AA v4.2 中 Astra medium 52,比 Sol max 51 高 1 点;Fable 5.1 medium 50 还是估算。换到 CursorBench,Fable medium 得分 68.0、Sol max 67.2,但那里没有 Astra。只能做同方法参考,不能说现实里等价,更不能换算智力百分比。

查看实测、估算和回退区别
Gemini 3.8 Flash 很便宜,工程能力够用吗?

有两种独立工程方法支持。DeepSWE high 为 74%±1、约 $2.36 / 题,与 Astra、Sol、Opus 5 的区间重叠;CursorBench high 得分 69.2。但它输出多、步骤多,低单价不等于等待最短。可先试有测试的真实任务,效率优先仍保留 3.7 对照。

查看工程价值与费用口径
Kimi K3 适合谁,值不值得现在试?

简单说:如果你经常做网页、React 原型、长资料、图片 / 视频理解或多步骤 Agent,K3 值得试。日常 Kimi Code 先用 k3-256k + high,资料真的超过 256K 再升 1M;API 也已支持 low / high / max。完整权重已经发布,但约 1.42 TiB 且使用自定义许可证,普通个人不要把“可下载”理解成“本地轻松运行”。

先看 60 秒结论、会员门槛和专业证据
敏感代码和文档能直接上传吗?

不能只看模型名称。需要同时核对服务地区、数据保留、训练使用、组织设置、工具权限和企业政策;开放权重也只有在受控环境中部署时,才可能带来更强的数据控制。

查看来源与限制
什么时候需要第二个模型复核?

影响上线、安全、合同、财务或重要决策时,建议换另一家模型独立检查。不同模型家族更容易暴露彼此的盲点,但最终仍需要原始证据和人工验收。

打开多模型对比

先选使用方式

会员、编程工具和 API 不是一回事

同一个模型从不同入口使用,价格、额度、工具权限和最终效果都可能不同。

01 · 日常聊天与写作

App 会员

直接使用 ChatGPT、Claude 等官方应用,适合不需要自己开发接口的个人用户。

怎么付费
通常按月订阅;使用额度可能动态调整。
需要确认
购买前核对官方套餐、所在地区和当日可用模型。
02 · 真实代码项目

编程工具

Codex、Claude Code、Cursor 等工具会给模型提供代码库、终端和文件修改能力。

怎么付费
可能是会员、按量计费,或同时包含两种方式。
需要确认
比较时要把模型和工具一起看,不能只比较模型名称。
03 · 自动化与产品接入

API 按量调用

开发者按输入、输出和部分附加能力计费,可接入自己的程序、工作流和产品。

怎么付费
与 App 会员分开计费;本页成本计算器估算的是这一类费用。
需要确认
还要考虑缓存、长上下文、重试和推理 token。
04 · 数据控制与自有环境

开放权重部署

把允许下载的模型部署在自己的设备或云环境中,获得更多运行与数据控制。

怎么付费
模型文件可能免费,但硬件、带宽、运维和许可合规仍有成本。
需要确认
开放权重不等于无限制使用,也不自动等于更安全。

套餐、额度和地区可用性变化很快。本报告解释选择方法,不用未经核实的社区传言替代购买当天的官方信息。

真实任务能力地图

这件具体的事,应该用谁

把宽泛的“编程、研究、写作”继续拆成真实工作。每项都给出首选、性价比替代、组合流程、证据强度和最大限制。

具体任务

修真实仓库 Bug

Astra、Opus 5、Sol 与 Gemini 3.8 在原创长程工程中处于同一领先区间;Cursor 内的模糊多文件任务可优先试 Fable 5.1,不能把不同工作台的分数混排。

较强:同口径仓库任务判断把握 · 核验 2026-09-05
更稳的组合流程单项强不够时,把不同能力串起来
  1. 1
    Astra · 实现

    复现、修改、运行测试并给出证据

  2. 2
    Fable 5.1 · 复核

    独立检查边界条件、遗漏文件和无关改动

最大限制

旧 Vals SWE-bench 已于 9 月 1 日归档,不再判断新模型胜负;各榜代理环境不同,真实私有仓库仍要复测。

推理强度

日常先 high;失败很贵时,直接升 xhigh / Max

下面先看同一代 Artificial Analysis 推理档曲线;模型总榜与 Sol 当前促销价已于 2026-08-29 复核。它不能代替真实仓库通过率、单题成本和等待;完整比较、低价执行分工与跨模型流程都在实战指南。

49实测
52实测
53实用起点
很高
54实测
最高
55最高单模型已测档
+1
GPT-6 Astra 的相邻最高档对照

很高 54 → 最高 55。指数点不是智力增幅或成功率。

建议从 high 开始

高难工程与研究先 high;边界清楚时 medium,返工代价高时可直接 xhigh/max。medium 的 AA 已邻近 Sol max,但不保证每项工作等效。

Max

这里指 API 最高单模型 effort。高档不保证每项任务更好;一次返工已比升档更贵时可直接用。

Ultra

这里指工具层多代理模式,不是上图 API effort 的下一档。没有同条件测试,不把 max 分数标成 Ultra 分数。

Fast

速度或处理优先级设置,不会让模型本身更聪明,通常会增加费用或额度消耗。

完整实战指南继续看 Astra、Fable 5.1、Sol 的任务分工、升档成本与多代理边界

真实编程

不同编程任务,强项不同

修真实仓库、从零做完整应用、在终端里坚持几十步,以及在 Cursor 中改多文件,是四件不同的事。

当前问题

固定同一代理框架,原创长任务能完成多少?

结论

Astra xhigh 74%±3%、Gemini 3.8 high 74%±1%、Opus 5 max 74%±4%、Sol max 73%±3%区间重叠,按同一领先档看。Astra和Sol每题约$6.5,Gemini约$2.36;这是任务平均费,不是成功任务成本。Fable 5.1尚无同榜结果。

2026-09-05 · mini-swe-agent · 113 项任务

保留原榜±误差;最佳已测配置不一定是最高effort。平均成本不含人工返工。

数据:DeepSWE v1.1 · 2026-09-03
模型Pass@1 %
1
原榜平均 $6.52 / 任务;不是会员扣量
2
原榜平均 $2.36 / 任务;不是会员扣量
3
原榜平均 $11.84 / 任务;不是会员扣量
4
原榜平均 $6.46 / 任务;不是会员扣量
5
原榜平均 $13.41 / 任务;不是会员扣量
6
原榜平均 $3.99 / 任务;不是会员扣量
7
原榜平均 $4.65 / 任务;不是会员扣量
8
原榜平均 $3.45 / 任务;不是会员扣量
9
原榜平均 $0.61 / 任务;不是会员扣量
10
原榜平均 $7.23 / 任务;不是会员扣量
11
原榜平均 $2.03 / 任务;不是会员扣量
12
原榜平均 $0.24 / 任务;不是会员扣量
13
原榜平均 $1.67 / 任务;不是会员扣量
14
原榜平均 $3.73 / 任务;不是会员扣量
15
原榜平均 $3.70 / 任务;不是会员扣量
16
原榜平均 $26.40 / 任务;不是会员扣量
17
原榜平均 $0.46 / 任务;不是会员扣量
18
原榜平均 $3.92 / 任务;不是会员扣量

单次 API 成本

估算一次 API 任务的成本

每百万 token 的挂牌价只是开始。先按你的输入、输出规模比较基础成本,再考虑缓存、长上下文、思考冗长度和失败重试。

这里算的是开发者 API 按量费用

这是开发者通过 API 按量调用的费用,不是 ChatGPT、Claude 等 App 的会员订阅费。普通聊天软件用户可以跳过本节。

高级设置:自定义 token 数量

不确定时不用修改,直接选择上面的任务规模即可。

按基础 API 价估算

$0.400

输入 50,000 × $4/M
输出 10,000 × $20/M

1.05M 上下文闭源 APIOpenAI 官方促销价,至少持续至 2026-11-21;输入超过 272K 后整次请求按 $8 / $30 计费,缓存写入按普通输入价的 1.25 倍计费

上下文是模型一次能处理的内容总量。这里已校验上限,并对 OpenAI 272K、Grok 200K、Qwen Plus 256K 和 MiniMax M3 512K 自动切换价格阶梯。仍未计入缓存命中、批处理、工具、失败重试和代理循环;Qwen 3.8 的人民币价格不混入美元计算器。

榜单可信度

第三方榜单是否可信

“谁测的、怎么测、拿谁的钱、是否统一代理、有没有模型裁判”,与最终分数同样重要。

审计结论

未发现付费买排名的可靠证据

但赞助、投资、API 额度、预发布送测、咨询客户和数据合作确实存在。所以我们看方法与交叉复现,不看“独立”两个字。
A−

Artificial Analysis

查看方法与页面
最适合
综合趋势、推理档位、速度和实际任务成本
不要用来
唯一的“模型 IQ”或严格等算力比较
方法与利益关系

v4.2 十项评测;Agent 30%、Coding 20%、科学推理 20%、General 30%,40% 权重来自私有保留题。部分使用 LLM 判分。

商业评测公司;提供咨询和定制评测,曾参与预发布送测。未见付费改排名证据;本报告锁定 2026-09-05 的 v4.2;估算行单独标记,不与实测同级。

最适合
私有真实任务、完整应用、统一轻量代理
不要用来
把 Vals Index 当成通用智力排名
方法与利益关系

Vals Index v2 按金融、编程、法律三组任务加权,包含五个私有和两个公开评测;不是通用智力百分比。

商业评测平台,向实验室与工程团队销售服务;未见逐模型赞助清单或付费改排名证据。

A− / B+
最适合
原创长程仓库任务、同一代理下的通过率与平均任务成本
不要用来
通用智力、产品体验、中文写作或某一家编程工具的直接排名
方法与利益关系

113 个原创任务、91 个仓库、5 种语言;统一 mini-swe-agent,在干净容器中用行为验证器判分并报告误差。

DataCurve 的独立公开榜;未发现付费改排名证据,商业关系与运行更新仍需持续复核。

最适合
闭式推理、数学、知识和代码题的抗污染比较
不要用来
完整应用、软件代理或长程工具调用
方法与利益关系

持续更新题目、客观真值、自动判分,不使用 LLM 裁判。

论文披露由 Abacus.AI 赞助;代码、题目、答案与评分公开。

A− / B

Terminal-Bench 2.1

查看方法与页面
最适合
同一 Terminus 2 下的长程终端与系统操作
不要用来
把混合总榜直接当作基础模型排名
方法与利益关系

任务与测试可检查,但总榜混合 Codex、Claude Code 和 Terminus 等不同代理。

Stanford × Laude 与社区项目;未见付费改排名证据。

B+ / C
最适合
在 Cursor 内的真实多文件编程体验
不要用来
中立的基础模型智力比较
方法与利益关系

真实会话任务,且会针对不同模型定制 harness;外界不能完整复现。

Cursor 自家私有榜,同时销售 Cursor 和自研 Composer;但主动披露过数据污染风险。

B− / C+

SWE-bench Verified

查看方法与页面
最适合
在同一 mini-SWE-agent 下辅助观察仓库修复
不要用来
2026 前沿模型的唯一代码结论
方法与利益关系

公开 GitHub 题目已饱和且可能进入训练;部分测试可能拒绝功能正确的补丁。

官网致谢 OpenAI、Anthropic、AWS、a16z 等支持;Verified 本身是与 OpenAI 合作项目。

最适合
人类主观偏好、回答风格和日常聊天体验
不要用来
正确率、严谨推理或实际编程能力
方法与利益关系

匿名两两投票,但长度、格式、语气与品牌可识别性都会影响偏好。

接受过无附加条件资金、云和 API 额度,后公司化融资;没有买榜证据。

详细证据

证据与来源

这里保留完整的型号辨析、独立数据、价格和方法说明。第一次阅读不必全部展开,需要核对时再点开。

官方事实厂商自报独立测试编辑推断
01OpenAI 与 Claude:最容易混淆的名称和推理档官方事实

GPT‑6 Astra 与 GPT‑5.6

  • Astra 是新的独立 API 模型,默认 high,支持 low、medium、high、xhigh、max;最高单模型档是 max。
  • Sol、Terra、Luna 都是独立 API 模型,默认推理档为 medium。
  • 共同支持 none、low、medium、high、xhigh、max。
  • Sol Pro 是 ChatGPT 产品模式;API 的 pro 是运行模式,不是第四款模型。
  • Ultra 是多代理编排,不是更高的单模型推理档,也没有可直接替代 AA max 的同条件成绩。
  • GPT‑5.5 Pro 只支持 medium、high、xhigh,默认 high;仅走 Responses API(另有 Batch)。
OpenAI GPT‑5.6 发布说明 ↗查看 Astra、Fable 5.1 与 Sol 全档对照

Claude

  • Fable 5.1 于 2026-09-01 发布,API 型号为 claude-fable-5-1;Opus 5 与旧 Fable 5 仍 Active。
  • Opus 5 默认 high,支持 low、medium、high、xhigh、max;xhigh / max 不能关闭思考。
  • Fable 5.1 与 Mythos 5.1 基于同一底层模型、保障机制不同;Mythos 审核限定,不是普通用户可直接选项。
  • Fable/Mythos 的自适应思考不能关闭。
  • Fable 5.1 支持 low、medium、high、xhigh、max;API / Claude Code 默认 high,Claude.ai / Cowork 默认 medium。
  • Claude Code 的 ultracode 使用 xhigh 并组织工作流,不是高于 max 的新档;API 升级仍需检查工具调用与思考块兼容性。
  • Opus 4.8 仍可用,但新任务应先比较 Opus 5;旧版连续观测不能直接当成新版成绩。
  • Sonnet 5 默认启用思考但可以关闭。
  • 符合条件的企业可申请 Fable ZDR,不能一概写“无 ZDR”,也不代表所有账号默认具备。
02Kimi K3、Gemini、Meta 与开放权重:怎样看新选择官方事实 + 独立测试
Kimi K3(已进入多源正式旗舰比较)
普通用户先看

K3 适合网页与 React 原型、长资料、图片 / 视频理解和多步骤 Agent 任务。只是聊天先用免费入口;重要事实要回到原始来源核对,小任务也不必为了“更强”直接使用更耗额度的 K3 集群。

技术人员口径

API 型号为 kimi-k3,上下文约 1M;缓存 / 输入 / 输出价格快照截至 2026-08-15 为 $0.30 / $3 / $15,预算前请核对官方当前价格。API 与 Kimi Code 均支持 low / high / max,默认分别为 max 与 high;Kimi Code 另有 k3-256k。集群、Websites 和动态工具属于不同产品层,不与裸 API 混算。

排名怎么读:9 月 5 日 AA v4.2 max 为 50,DeepSWE max 为 69%±5、约 $4.65 / 题。它仍是开放权重与长资料强候选,但不能由综合分推导成所有任务领先。旧 Vals、Arena 快照保留各自日期,不与当前 AA 新方法分数混算。

7 月 31 日动态复核:K3 的完整权重、技术报告和 Kimi K3 License 已正式发布;官方 Hugging Face 的 96 个权重分片合计约 1.42 TiB,因此“可自行部署”和“普通电脑能轻松运行”是两件事。CursorBench 也补入模糊多文件边界:K3 max 60.8% / $2.70,已可用但没有领先 Opus / Sol 高档位。综合前沿档与视觉专项结论不变。

Kimi K2.7 Code

K3 已成为新旗舰并发布完整权重,但 K2.7 Code 仍是更轻、更便宜的代码专项。普通版缓存 / 输入 / 输出为 $0.19 / $0.95 / $4,HighSpeed 是同一模型的高速服务,按 $0.38 / $1.90 / $8 计费。官方 Kimi Code Bench v2 从 50.9 提升到 62.0;AA v4.2 为 34(估算),不能把代码专项当成全面升级。

Kimi 官方文档 ↗官方模型卡与 Kimi Code Bench v2 ↗
Meta Muse Spark 1.2(正式专项,不是通用前三)

1.2 的 AA v4.2 xhigh 为 47;既有 DeepSWE 与 Vals 专业任务支持法律、金融与长代理专项,不代表通用前三。9 月 2 日已有 1.3,但版本不同,不能继承 1.2 的专业成绩;1.1 继续只作历史基线。

Meta 官方发布 ↗AA 当前模型页 ↗DeepSWE 长程工程 ↗
Meta Muse Spark 1.3(有新证据,仍属观察)

AA v4.2 公共 xhigh 为 52,max 为 53;max 的准入与公开价格存在差异口径。Meta 自跑的 DeepSWE 不算第二种独立方法,当前原始榜未提供 1.3,所以先试公共 xhigh,不把它列成已证实的通用或代码冠军,也不继承 1.2 的法律金融成绩。

GLM‑5.3 / GLM‑5.3 Flash

GLM‑5.3:AA v4.2 max 49、DeepSWE max 69%±3,已有综合与原创长程工程两种独立信号。以 100 道类似工程任务作比例示意,点估计比 Sol max 少约 4 道;误差重叠,不把它变成你真实项目的固定差距。

GLM‑5.3 Flash / Ox Alpha:AA v4.2 为 46,AA 原页未附 effort 标签;DeepSWE max 为 63%±4、平均约 $0.24 / 题,比 Sol max 点估计低 10 个百分点。它适合强模型写好计划后的低价执行;不适合独立负责模糊需求、架构、安全和最终批准。

完整 GLM‑5.3 约 753B 总参数、40B 激活,权重约 756 GB;Flash 为 320B / 18B、MIT。两者都支持 1M,但“开放权重”不等于普通电脑能流畅部署。GLM‑5.2 退到历史基线,不再参与正式推荐。

DeepSeek V4 Pro 0813 / Flash 0731 / Qwen 3.8 Max

Pro 0813:AA v4.2 max 为 42,DeepSWE max 为 63%±6、约 $1.67 / 题,继续支持低价代码专项,不支持综合超过 K3。旧 Vals SWE‑bench 已归档,不再用于判定新模型胜负。峰时 $1.32 / $3.96、非峰 $0.66 / $1.98;MIT 权重与 API 工具入口另行核对。

Flash 0731:本站仍只用 max 下结论。AA v4.2 max 为 41,42 是 Vision 分支,不能混用;DeepSWE max 为 53%±4、平均约 $0.46 / 题,旧 $0.10 不是当前账单。它适合计划明确、能自动验收的低价支线,不适合独立负责模糊需求。

Qwen 3.8 Max:正式版 AA v4.2 为 47,保留中文与云生态强候选。Qwen3.8‑Flash‑Next 已有同版本 AA v4.2 46,不再是“只有厂商成绩”;但尚缺第二种独立工程方法,因此继续观察,不用厂商自报的 DeepSWE 58.7 晋升代码主力。

MiniMax M3

当前 M 系列重点面向代码与代理任务,具备官方、AA 与 LiveBench 证据,因此进入专项和成本轨道。它使用 MiniMax Community License,商业部署需要单独核对许可条件。

MiniMax 官方模型页 ↗
Gemini 3.8 Flash:工程价值提高,不等于所有任务更快

9 月 2 日发布的 3.8 high 在 DeepSWE 为 74%±1 / $2.36,CursorBench 为 69.2% / $2.38,两种方法支持正式工程与成本推荐。AA v4.2 high 为 47。DeepSWE 输出约 143K、166 步,说明低单价不等于低步骤或短等待;3.7 仍是效率优先对照,当前 DeepSWE medium 为 65%±3 / $2.03。两版 $0.75 / $3.75 介绍价均到 2026 年底。

查看 Gemini 3.8 资料页Google 官方模型卡 ↗
K3 与网站现有主力模型怎么比

对 Opus 5 / 4.8:Opus 5 的 AA v4.2 max 为 54,Vals Index v2 为 67.21%,DeepSWE max 为 74%±4。K3 在开放部署、长资料与中文产品入口仍有价值;综合指数差不是所有真实任务的固定差距。

对 Fable 5.1 / Astra / Sol:新前沿模型已有精确版本 AA、Vals 和部分工程数据;K3 不因新名称出现而失去用途,也不能沿用旧榜位置。要按任务、工作台、推理档和实际成本比较。

对 K2.6 / K2.7 Code:K3 已成为 API、Kimi Code 与开放权重能力上限;需要更低价格、更小部署体量、成熟代码专项或 K2.7 HighSpeed 时,上一代型号仍更容易控制成本和风险。

对 GLM、Qwen、DeepSeek、Grok、Gemini:GLM‑5.3 保留开放权重前沿,Grok 4.6 保留低价前沿;GLM Flash 与 DeepSeek 负责可验收的低价支线,Gemini 3.8 补入强工程与多模态,Qwen 保留中文生态。一个专项结果不能改写 K3 的全部定位。

03厂商官方成绩:看上限,也看口径厂商自报

以下保留 GPT‑5.6 与 Fable 5 等旧型号发布时的历史表,不代表 2026 年 9 月现行排名,也不属于 AA v4.2。厂商代理、工具、超时、采样和推理档不统一;Astra / Fable 5.1 的现行独立对照请看下一节。

GPT‑5.6 发布历史表

手机上可左右滑动查看完整表格

模型AA 发布时口径AA CodeSWE ProTB 2.1
GPT-5.6 Sol58.980.064.6%88.8%
GPT-5.6 Terra55.077.463.4%87.4%
GPT-5.6 Luna51.274.662.7%84.7%

Sol 的 AA 项明确为 max;SWE‑Bench Pro 与 Terminal‑Bench 页面未逐项披露完整 effort / harness。Sol Ultra 是四代理编排,不混入单模型表。

OpenAI GPT‑5.6 官方表 ↗

旧版 Claude 系统卡历史表

手机上可左右滑动查看完整表格

模型SWE ProTB 2.1OSWorldHLE + tools
Claude Fable 580.0%84.3%85.0%
Claude Opus 4.869.2%82.7%83.4%57.9%
Claude Sonnet 563.2%80.4%81.2%57.4%

Terminal‑Bench 使用 mini‑SWE‑agent;Fable high 的 20.9% 轨迹触发安全拒答后由 Opus 4.8 接续,因此 84.3% 不是纯底模无回退分数。

Kimi 的官方代码专项信号

Kimi Code Bench v2:K2.6 50.9 → K2.7 Code 62.0;同一官方表中 GPT‑5.5 + Codex xhigh 为 69.0、Opus 4.8 + Claude Code xhigh 为 67.4。它能证明 K2.7 的代码专项进步,但仍是厂商自建榜与不同代理组合。

Kimi 官方模型卡 ↗
04同版本独立数据快照AA + Vals + CursorBench + DeepSWE

核验日期:2026-09-05。AA 于 9 月 4 日从 v4.1.1 切换为 v4.2,新增 Briefcase、GDP.pdf 等并调整权重与判分;旧分数下移不代表模型变差。综合指数、Cursor 代理得分和原创工程通过率不能相加,也不能换算成“智力提升百分比”。

Fable 5.1、Astra 与 Sol:不同任务,没有统一档位等效

AA v4.2 最高档分别是 57、55、51。Fable 5.1 的 low / medium / high / xhigh 为 48 / 50 / 52 / 54,但这四档明确是估算;max 57 是已测结果,且整组含 Opus 安全回退。Astra 与 Sol 的 low 至 max 均未标估算。不能把 Fable 的估算曲线称为完整独立实测。

CursorBench 3.2 中 Fable 5.1 low 得分 66.2、medium 68.0,跨过 Sol max 67.2;这只是 Cursor 中的得分参照。Fable max 73.4 比 xhigh 72.8 多 0.6 个百分点,平均任务费用从 $6.96 到 $9.64,约多 39%。当前未找到 Astra 的同版本 CursorBench,不能填补或外推。

DeepSWE:Astra、Sol、Opus 5 与 Gemini 3.8 在同一领先区间

9 月 3 日的 v1.1 固定 mini-swe-agent、113 个原创工程任务:Astra xhigh 74%±3 / $6.52,Sol max 73%±3 / $6.46,Opus 5 max 74%±4 / $11.84,Gemini 3.8 high 74%±1 / $2.36。区间重叠,不宣称 Astra 稳定多完成真实项目;Gemini 是强成本候选,但 143K 输出、166 步不等于最快。

Fable 5.1 没有同版本原榜记录;70%±3 是旧 Fable 5 xhigh。Grok 4.6 当前为 medium 67%±2,Gemini 3.7 为 medium 65%±3,DeepSeek Flash 0731 max 为 53%±4 / $0.46。模型、推理档和日期都必须保留。

Vals:使用现行 v2,保留安全回退与快照日期

9 月 4 日 Vals Index v2 为 Fable 5.1 68.83%、Opus 5 67.21%、Astra 66.61%、Sol 63.71%、Gemini 3.8 62.25%、Grok 4.6 59.17%。这是加权专业任务指数,不是整体经济自动化率。Fable 5.1 含 Opus 回退,发布日 67.87% 及其“回退算失败”结果不直接套用到现在的 68.83%。

Terminal-Bench 2.1 当前列 Astra max 87.27%、Sol max 85.77%、Fable 5.1 max 85.02%,使用 89 个任务与 Terminus 2。旧 SWE-bench 已于 9 月 1 日归档,不再判断新模型胜负;VibeCode 不同型号发布记录也不能一律叫当天重测。Vals 页面费用可能沿用旧 token 价,不能当今天的促销账单。

手机上可左右滑动查看完整表格

模型 / 站内定位AA v4.2所示档位与估算状态核验日期 / 原始来源
Claude Fable 5.1
高难任务旗舰
57max · 含安全回退
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GPT-6 Astra
高难任务旗舰
55max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Claude Opus 5
高端实用与复核
54max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Claude Fable 5
上一代 Fable 基线
53max · Opus 4.8 回退
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Meta Muse Spark 1.3
新品观察
52xhigh
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GPT-5.6 Sol
成熟高端与成本路线
51max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Grok 4.6
低价前沿旗舰
51high
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Kimi K3
通用旗舰 · 新发布
50max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GLM-5.3
开放权重前沿旗舰
49max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Gemini 3.8 Flash
高性价比多模态执行
47high
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GPT-5.6 Terra
均衡型号
47max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Meta Muse Spark 1.2
法律金融与长代理专项
47xhigh
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Qwen 3.8 Max
国产强第二梯队旗舰
47原页未标档位
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GPT-5.5
上一代基线
46(估算)xhigh
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
Claude Opus 4.8
成熟高端基线
46(估算)max
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
GLM-5.3-Flash
低价合格执行者
46原页未标档位
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Claude Sonnet 5
均衡执行型号
45max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Grok 4.5
上一代 Grok 基线
45high
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Gemini 3.7 Flash
效率价值与成熟流程
45high
AA 未标估算
2026-09-05
AA 原始模型页 ↗
GPT-5.6 Luna
轻量高吞吐
43max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Meta Muse Spark 1.1
上一代代理基线
43(估算)xhigh
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
GLM-5.2
上一代开放权重基线
43(估算)max
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
Gemini 3.5 Flash
上一代多模态基线
42(估算)high
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
DeepSeek V4 Pro 0813
低价长程代码专项
42max
AA 未标估算
2026-09-05
AA 原始模型页 ↗
DeepSeek V4 Flash 0731
低成本可验收候选
41max · 0731
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Gemini 3.6 Flash
上一代 Gemini 基线
40high
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Qwen 3.7 Max
上一代千问基线
37(估算)Thinking
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
Kimi K2.6
上一代通用开放权重型号
36(估算)Thinking
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
MiniMax M3
国产代码与代理专项
36未提供正式 effort
AA 未标估算
2026-09-05
AA 原始模型页 ↗
Kimi K2.7 Code
Kimi 编程专项
34(估算)Thinking
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗
Qwen 3.7 Plus
中文成本型号
31(估算)Thinking
AA 明确标注 estimated
2026-09-05
AA 原始模型页 ↗

表中是该精确版本已核对的展示变体,不自动等于官方最高 effort;“估算”和“未标估算”不是相同证据等级。受限、观察和历史型号即使有分,也不自动进入正式推荐;没有取得分数的型号不按零分处理。Flash 0731 为 41,不能用 Vision 分支的 42 替代。

05API 基础价格与隐藏成本官方定价

手机上可左右滑动查看完整表格

模型缓存读 $/M输入 $/M输出 $/M需要注意
GPT-6 Astra$1$10$50输入 >272K:$20 / $75;API 默认 high,最高 max
Claude Fable 5.1$0.25$10$50普通输入 / 输出未降;缓存读取比 Fable 5 低 75%;会员另计
GPT-5.5 Pro$30$180仅 Responses API;无缓存价
Fable / Mythos 5$1$10$50旧版 API 仍 Active;Mythos 审核限定,ZDR 依企业资格
Claude Opus 5$0.50$5$251M;默认 high;fast 模式为 $10 / $50
GPT-5.6 Sol$0.40$4$20促销至少至 2026-11-21;输入 >272K:$8 / $30
GPT-5.5$0.50$5$30仍有正式 API
Claude Opus 4.8$0.50$5$25成熟旧流程与连续观测基线
GPT-5.6 Terra$0.20$2$127 月 30 日降价 20%;输入 >272K:$4 / $18
Claude Sonnet 5$0.20$2$10已成为标准价格;原定 9 月涨价已取消
Grok 4.6$0.50$2$6输入 >200K:$4 / $12;四种独立信号支持低价前沿
GLM-5.3$0.26$1.40$4.40开放权重前沿;自定义许可证
GLM-5.3 Flash$0.03$0.15$0.50MIT;本站用长期价,五折优惠至 2026-09-09
Meta Muse Spark 1.2(专项)$0.15$1.25$4.25法律、金融与可恢复长代理
Meta Muse Spark 1.3 xhigh(观察)$0.15$1.25$4.25公共 xhigh 价格;max 准入与公开价格仍待确认
GPT-5.6 Luna$0.02$0.20$1.207 月 30 日降价 80%;输入 >272K:$0.40 / $1.80
Gemini 3.8 / 3.7 Flash$0.075$0.75$3.75介绍价至 2026-12-31;之后 $1.50 / $7.50;存储另计
Kimi K3$0.30$3$15价格快照截至2026-08-15;预算前核对官方;1M、low / high / max
Kimi K2.6$0.16$0.95$4上一代开放权重通用型号;思考模式可开关
Kimi K2.7 Code$0.19$0.95$4HighSpeed 为两倍价
MiniMax M3$0.06$0.30$1.20>512K 为 $0.60 / $2.40;商业许可需核对
Qwen 3.8 Max¥1.50¥12¥36中国端人民币价;不与美元计算器混算
Qwen 3.7 Plus按部署$0.40$1.60国际端点 ≤256K;越界 $1.20 / $4.80
DeepSeek V4 Pro 0813$0.044$1.32$3.96峰时安全上限;非峰 $0.66 / $1.98;MIT 权重
DeepSeek V4 Flash 0731$0.014$0.44$1.32峰时安全上限;非峰 $0.22 / $0.66;只比较 max

OpenAI:Astra 为 $10 / $50,输入超过 272K 后整次请求为 $20 / $75;Sol 的 $4 / $20 促销至少持续至 2026‑11‑21,越过 272K 后为 $8 / $30。API 缓存写入另计,会员额度不按这张表直接换算。

Qwen:Max 单列中国端人民币,Plus 是国际端点美元,不直接混算;不同部署可能有不同价格与阶梯,计算器只自动处理已列明的端点规则。

DeepSeek:当前别名分别映射到 Flash 0731 与 Pro 0813;表内用工作日峰时安全上限,非峰时约半价。Vision Exp 是图片输入实验分支,不是通用能力升级。

GLM:GLM‑5.3 Flash 的五折价只到 2026‑09‑09 24:00(UTC+8),因此计算器与长期预算使用 $0.15 / $0.50 的 list price。

Anthropic:1M 没有同类溢价;Fable 5.1 普通输入 / 输出仍为 $10 / $50,只有缓存读取从 $1 降至 $0.25。相对 Opus 5 哪个更省取决于缓存和输出构成,不能概括为全部便宜或全部两倍价。Sonnet 5 的 $2 / $10 已是标准价。

真正成本:挂牌价 × token 只是基础;还要加上思考冗长度、失败重试、工具调用和代理循环。

06为什么不同榜单会得出相反结论?方法解释

测试对象可能不同

  • 基础模型不等于 Codex、Claude Code、Cursor 或 Terminus 代理。
  • 同一模型换工具、系统提示、超时和 token 上限,结果会显著变化。
  • max 与 high 的算力预算不同,不能解释成纯粹模型 IQ。

题目与评分也不同

  • 公开题容易污染;私有题更抗污染,但外界无法完整复现。
  • LLM 裁判适合开放任务,却会引入风格和评分模型偏见。
  • 人类偏好榜更喜欢语气、格式和长度,不代表答案更正确。

最终结论

四条最终建议

03

预算看成功任务成本

需要较强判断又想省钱,先小测 Grok 4.6;强模型已写清计划、有机器测试的支线可试 GLM‑5.3 Flash max,另一条代码路线再看 DeepSeek Pro max。把重试、等待和人工返工一起算。

04

多模态和开放部署分开选

音视频与 Google 工具先看 Gemini 3.8,长 PDF 的高质量阅读也比较 Astra。开放权重前沿可比较 GLM‑5.3K3,但需要大型推理基础设施;低成本服务先用 GLM‑5.3 Flash 等 API 验证真实任务。

默认推荐路线Astra high;Fable 5.1 high/xhigh;高价值难题可用 max

Astra 做工程闭环,Fable 5.1 交叉复核Astra / Fable 5.1 先从 high 开始;难题或返工代价高时可直接 xhigh/max。Fable 的 AA 中低档是估算,选择档位同时看 Cursor 实测。

重新选择 ↑