模型像“大脑”;Codex、Claude Code、Cursor 像“工作台”。同一模型换工具,实际编程效果也会变。
独立交叉验证23 个正式可比模型8 类第三方来源
AI 大模型选择器先看你要做什么,再看谁更合适
先按任务给出能直接照着用的结论,再展开证据、成本与局限;新品观察不混入正式排名。
覆盖哪些模型与证据
本站把 GPT、Claude、Gemini、Grok、Meta、GLM、DeepSeek、Qwen、Kimi 和 MiniMax 放进同一张能力地图。目前有 23 个正式可比模型,另保留 11 个新品观察或历史基线资料项。
型号和价格由官方资料确认;强能力结论至少需要两个方法不同的独立来源互相支持。
Astra 做工程闭环,Fable 5.1 交叉复核。高难仓库与终端任务先评估 Astra;含糊需求、多文件规划和独立复核用 Fable 5.1。预算敏感且验收明确时,Sol 仍是成熟执行路线。
30 秒 · 三个问题
按你的实际用法选择
Astra 做工程闭环,Fable 5.1 交叉复核
高难仓库与终端任务先评估 Astra;含糊需求、多文件规划和独立复核用 Fable 5.1。预算敏感且验收明确时,Sol 仍是成熟执行路线。
Astra / Fable 5.1 先从 high 开始;难题或返工代价高时可直接 xhigh/max。Fable 的 AA 中低档是估算,选择档位同时看 Cursor 实测。
先说明我们怎么判断
我们如何判断
官方资料只负责确认名称、规格、价格与可用性;能力结论至少需要两个方法不同的第三方来源互相支持。模型、推理档位、代理框架和测试版本都会单独标注。 如果“相差 1 分”仍没有体感,可以查看 分差、任务成功率、费用与等待的同屏解释。
四条分轨排行榜
按你关心的问题看排名
没有一个万能总榜。旗舰上限、日常实用、成本价值和专项能力分别回答不同问题;想自己挑选 2—4 个模型逐项核对,可以继续进入 多模型直接对比。
只比较版本明确、公开可用的通用旗舰最佳已测配置;最高得分不总在最高推理档。AA 估算和 Ultra 多代理不混入正式榜。
AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。
核验 2026-09-05AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
核验 2026-09-05AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。
核验 2026-09-05AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。
核验 2026-09-05AA v4.2 max 49、K3 max 50;仍属开放权重高端,不能把英文综合与代码结果外推成所有中文任务同档。
核验 2026-09-05AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。
核验 2026-09-05AA 数字固定为 2026-09-05 核对的 v4.2 快照;旗舰榜排除估算,最佳已测档不一定是最高 effort。指数点不是 IQ 或成功率百分比。成本轨道不表示效果相同,专项轨道也不是通用排名。
普通用户先看这里
看懂这些词就够了
不需要会编程。后文遇到这些词时,可以按下面的简单意思理解。
让同一模型多花多少步骤读、试、用工具和复查。越高通常越慢、越贵,也不保证每项任务都更好;Max 是单模型,Ultra 是多代理。
token 是计费和处理文字的小单位;上下文是一次能记住的内容量;缓存是重复内容少算一次钱。
API 是开发者按量调用模型的接口;开放权重表示模型文件可下载部署,不等于完全免费或没有许可限制。
让不同模型使用尽量相同的提示、工具、时间和评分方法。这样比直接拼接各厂商自报分数更公平。
先回答最常见的问题
选模型前,先弄清这九件事
先看简短答案,需要核对分数、价格和来源时,再继续查看后面的专业部分。
只能买一个会员,应该怎么选?
先看常做任务与套餐实际包含的模型。Astra 适合工程、终端与复杂分析,Fable 5.1 值得试模糊多文件和复杂交付;但 Claude Pro 的 Fable 需额外点数,Max 也有共享周额度上限。日常任务不必为最高档付费,购买前核对官方权益。
按自己的用途选一次 →会员和 API 有什么区别?
会员是 ChatGPT、Claude 等应用的套餐;API 是开发者按输入和输出量付费。两者的价格、额度、工具权限和数据条款不同,不能把每百万 token 价格当成会员费。
查看四种使用方式 →编程效果是模型决定,还是工具决定?
两者共同决定。Codex、Claude Code、Cursor 等工具会提供不同的终端、检索、上下文管理和重试方式,同一模型换一个工作台,实际结果可能明显变化。
查看编程任务分榜 →medium、high、xhigh、max 怎么选?
按型号和入口选:Astra、Fable 5.1 的 API 默认 high,Sol 默认 medium,Fable 在 Claude.ai 默认 medium。先用默认档,难题再比较 xhigh / max 的增益;最高档可能只略有提升却明显更贵。Ultra 或 Ultracode 是工作流,不是更高的裸模型档。
查看三型号全档、费用与限制 →GLM-5.3 Flash 分数很高,能直接替代 Sol 吗?
不能直接替代。AA v4.2 中 Flash 为 46,等于 Sol medium 的点估计,不是旧方法下的 Sol high;原创长程工程为 63%±4,比 Sol max 点估计低 10 个百分点。让强模型先写清计划和测试,再让 Flash max 执行可回滚支线;理解错就升级,不要无限重跑。
看高分与真实任务差距 →Astra 和 Fable 5.1 相当于 Sol 的哪一档?
没有跨任务统一答案。AA v4.2 中 Astra medium 52,比 Sol max 51 高 1 点;Fable 5.1 medium 50 还是估算。换到 CursorBench,Fable medium 得分 68.0、Sol max 67.2,但那里没有 Astra。只能做同方法参考,不能说现实里等价,更不能换算智力百分比。
查看实测、估算和回退区别 →Gemini 3.8 Flash 很便宜,工程能力够用吗?
有两种独立工程方法支持。DeepSWE high 为 74%±1、约 $2.36 / 题,与 Astra、Sol、Opus 5 的区间重叠;CursorBench high 得分 69.2。但它输出多、步骤多,低单价不等于等待最短。可先试有测试的真实任务,效率优先仍保留 3.7 对照。
查看工程价值与费用口径 →Kimi K3 适合谁,值不值得现在试?
简单说:如果你经常做网页、React 原型、长资料、图片 / 视频理解或多步骤 Agent,K3 值得试。日常 Kimi Code 先用 k3-256k + high,资料真的超过 256K 再升 1M;API 也已支持 low / high / max。完整权重已经发布,但约 1.42 TiB 且使用自定义许可证,普通个人不要把“可下载”理解成“本地轻松运行”。
先看 60 秒结论、会员门槛和专业证据 →先选使用方式
会员、编程工具和 API 不是一回事
同一个模型从不同入口使用,价格、额度、工具权限和最终效果都可能不同。
App 会员
直接使用 ChatGPT、Claude 等官方应用,适合不需要自己开发接口的个人用户。
- 怎么付费
- 通常按月订阅;使用额度可能动态调整。
- 需要确认
- 购买前核对官方套餐、所在地区和当日可用模型。
编程工具
Codex、Claude Code、Cursor 等工具会给模型提供代码库、终端和文件修改能力。
- 怎么付费
- 可能是会员、按量计费,或同时包含两种方式。
- 需要确认
- 比较时要把模型和工具一起看,不能只比较模型名称。
API 按量调用
开发者按输入、输出和部分附加能力计费,可接入自己的程序、工作流和产品。
- 怎么付费
- 与 App 会员分开计费;本页成本计算器估算的是这一类费用。
- 需要确认
- 还要考虑缓存、长上下文、重试和推理 token。
开放权重部署
把允许下载的模型部署在自己的设备或云环境中,获得更多运行与数据控制。
- 怎么付费
- 模型文件可能免费,但硬件、带宽、运维和许可合规仍有成本。
- 需要确认
- 开放权重不等于无限制使用,也不自动等于更安全。
套餐、额度和地区可用性变化很快。本报告解释选择方法,不用未经核实的社区传言替代购买当天的官方信息。
真实任务能力地图
这件具体的事,应该用谁
把宽泛的“编程、研究、写作”继续拆成真实工作。每项都给出首选、性价比替代、组合流程、证据强度和最大限制。
Opus 5、Sol 与 GLM‑5.3 都能承担强主线:分别偏开放式构建、终端闭环与开放权重前沿。 K3 保留视觉互动与超长资料专项;Fable 仍是高价 A/B,不因官方定位自动成为默认。
把模糊产品目标变成多文件成品,适合边讨论边推进
更主动也更容易扩大范围;长程代码与 Sol 同档,不是纯编码唯一冠军工程执行Sol仓库修复、终端与高难度推理
长程代码与 Opus 5 同档;优势更多在测试闭环、成本和输出克制开放前沿GLM-5.3复杂代码、中文专业任务与开放权重部署候选
AA 与 DeepSWE 已进前沿;权重约 756 GB,仍不是普通电脑轻量方案视觉新强Kimi K3WebDev、React、互动应用与超长任务
日常 Code 先用 k3-256k;1M 约耗两倍额度,事实与安全任务仍需复核修真实仓库 Bug
Astra、Opus 5、Sol 与 Gemini 3.8 在原创长程工程中处于同一领先区间;Cursor 内的模糊多文件任务可优先试 Fable 5.1,不能把不同工作台的分数混排。
DeepSWE xhigh 74%±3、Vals 终端 max 87.27%,支持长链路实现与验证。
模糊多文件候选Fable 5.1CursorBench max 73.4%,但没有同版本 DeepSWE 结果,需在自己的仓库验证。
成熟 Claude 对照Opus 5DeepSWE max 74%±4,仍在领先区间;是否比新版省钱要看缓存、输出与重试。
性价比替代Gemini 3.8DeepSWE high 74%±1、约 $2.36 / 题,进入同一领先区间;输出量和步骤较多。
- 1Astra · 实现
复现、修改、运行测试并给出证据
- 2Fable 5.1 · 复核
独立检查边界条件、遗漏文件和无关改动
旧 Vals SWE-bench 已于 9 月 1 日归档,不再判断新模型胜负;各榜代理环境不同,真实私有仓库仍要复测。
推理强度
日常先 high;失败很贵时,直接升 xhigh / Max
下面先看同一代 Artificial Analysis 推理档曲线;模型总榜与 Sol 当前促销价已于 2026-08-29 复核。它不能代替真实仓库通过率、单题成本和等待;完整比较、低价执行分工与跨模型流程都在实战指南。
很高 54 → 最高 55。指数点不是智力增幅或成功率。
高难工程与研究先 high;边界清楚时 medium,返工代价高时可直接 xhigh/max。medium 的 AA 已邻近 Sol max,但不保证每项工作等效。
AA Intelligence Index v4.2 · 核验 2026-09-05。* 为 AA 估算,不能当作完整独立实测;Fable 含安全回退。图中 API 单模型档不代表产品里的 Ultra 多代理。
查看同版本原始档位数据 ↗查看 Astra 完整资料 →这里指 API 最高单模型 effort。高档不保证每项任务更好;一次返工已比升档更贵时可直接用。
这里指工具层多代理模式,不是上图 API effort 的下一档。没有同条件测试,不把 max 分数标成 Ultra 分数。
速度或处理优先级设置,不会让模型本身更聪明,通常会增加费用或额度消耗。
真实编程
不同编程任务,强项不同
修真实仓库、从零做完整应用、在终端里坚持几十步,以及在 Cursor 中改多文件,是四件不同的事。
当前问题
固定同一代理框架,原创长任务能完成多少?
Astra xhigh 74%±3%、Gemini 3.8 high 74%±1%、Opus 5 max 74%±4%、Sol max 73%±3%区间重叠,按同一领先档看。Astra和Sol每题约$6.5,Gemini约$2.36;这是任务平均费,不是成功任务成本。Fable 5.1尚无同榜结果。
2026-09-05 · mini-swe-agent · 113 项任务
保留原榜±误差;最佳已测配置不一定是最高effort。平均成本不含人工返工。
数据:DeepSWE v1.1 · 2026-09-03单次 API 成本
估算一次 API 任务的成本
每百万 token 的挂牌价只是开始。先按你的输入、输出规模比较基础成本,再考虑缓存、长上下文、思考冗长度和失败重试。
这是开发者通过 API 按量调用的费用,不是 ChatGPT、Claude 等 App 的会员订阅费。普通聊天软件用户可以跳过本节。
高级设置:自定义 token 数量
不确定时不用修改,直接选择上面的任务规模即可。
按基础 API 价估算
输入 50,000 × $4/M
输出 10,000 × $20/M
上下文是模型一次能处理的内容总量。这里已校验上限,并对 OpenAI 272K、Grok 200K、Qwen Plus 256K 和 MiniMax M3 512K 自动切换价格阶梯。仍未计入缓存命中、批处理、工具、失败重试和代理循环;Qwen 3.8 的人民币价格不混入美元计算器。
榜单可信度
第三方榜单是否可信
“谁测的、怎么测、拿谁的钱、是否统一代理、有没有模型裁判”,与最终分数同样重要。
审计结论
未发现付费买排名的可靠证据
但赞助、投资、API 额度、预发布送测、咨询客户和数据合作确实存在。所以我们看方法与交叉复现,不看“独立”两个字。Artificial Analysis
查看方法与页面- 最适合
- 综合趋势、推理档位、速度和实际任务成本
- 不要用来
- 唯一的“模型 IQ”或严格等算力比较
方法与利益关系
v4.2 十项评测;Agent 30%、Coding 20%、科学推理 20%、General 30%,40% 权重来自私有保留题。部分使用 LLM 判分。
商业评测公司;提供咨询和定制评测,曾参与预发布送测。未见付费改排名证据;本报告锁定 2026-09-05 的 v4.2;估算行单独标记,不与实测同级。
Vals AI
查看方法与页面- 最适合
- 私有真实任务、完整应用、统一轻量代理
- 不要用来
- 把 Vals Index 当成通用智力排名
方法与利益关系
Vals Index v2 按金融、编程、法律三组任务加权,包含五个私有和两个公开评测;不是通用智力百分比。
商业评测平台,向实验室与工程团队销售服务;未见逐模型赞助清单或付费改排名证据。
DeepSWE v1.1
查看方法与页面- 最适合
- 原创长程仓库任务、同一代理下的通过率与平均任务成本
- 不要用来
- 通用智力、产品体验、中文写作或某一家编程工具的直接排名
方法与利益关系
113 个原创任务、91 个仓库、5 种语言;统一 mini-swe-agent,在干净容器中用行为验证器判分并报告误差。
DataCurve 的独立公开榜;未发现付费改排名证据,商业关系与运行更新仍需持续复核。
LiveBench
查看方法与页面- 最适合
- 闭式推理、数学、知识和代码题的抗污染比较
- 不要用来
- 完整应用、软件代理或长程工具调用
方法与利益关系
持续更新题目、客观真值、自动判分,不使用 LLM 裁判。
论文披露由 Abacus.AI 赞助;代码、题目、答案与评分公开。
Terminal-Bench 2.1
查看方法与页面- 最适合
- 同一 Terminus 2 下的长程终端与系统操作
- 不要用来
- 把混合总榜直接当作基础模型排名
方法与利益关系
任务与测试可检查,但总榜混合 Codex、Claude Code 和 Terminus 等不同代理。
Stanford × Laude 与社区项目;未见付费改排名证据。
CursorBench 3.2
查看方法与页面- 最适合
- 在 Cursor 内的真实多文件编程体验
- 不要用来
- 中立的基础模型智力比较
方法与利益关系
真实会话任务,且会针对不同模型定制 harness;外界不能完整复现。
Cursor 自家私有榜,同时销售 Cursor 和自研 Composer;但主动披露过数据污染风险。
SWE-bench Verified
查看方法与页面- 最适合
- 在同一 mini-SWE-agent 下辅助观察仓库修复
- 不要用来
- 2026 前沿模型的唯一代码结论
方法与利益关系
公开 GitHub 题目已饱和且可能进入训练;部分测试可能拒绝功能正确的补丁。
官网致谢 OpenAI、Anthropic、AWS、a16z 等支持;Verified 本身是与 OpenAI 合作项目。
LM Arena
查看方法与页面- 最适合
- 人类主观偏好、回答风格和日常聊天体验
- 不要用来
- 正确率、严谨推理或实际编程能力
方法与利益关系
匿名两两投票,但长度、格式、语气与品牌可识别性都会影响偏好。
接受过无附加条件资金、云和 API 额度,后公司化融资;没有买榜证据。
详细证据
证据与来源
这里保留完整的型号辨析、独立数据、价格和方法说明。第一次阅读不必全部展开,需要核对时再点开。
01OpenAI 与 Claude:最容易混淆的名称和推理档官方事实
GPT‑6 Astra 与 GPT‑5.6
- Astra 是新的独立 API 模型,默认 high,支持 low、medium、high、xhigh、max;最高单模型档是 max。
- Sol、Terra、Luna 都是独立 API 模型,默认推理档为 medium。
- 共同支持 none、low、medium、high、xhigh、max。
- Sol Pro 是 ChatGPT 产品模式;API 的 pro 是运行模式,不是第四款模型。
- Ultra 是多代理编排,不是更高的单模型推理档,也没有可直接替代 AA max 的同条件成绩。
- GPT‑5.5 Pro 只支持 medium、high、xhigh,默认 high;仅走 Responses API(另有 Batch)。
Claude
- Fable 5.1 于 2026-09-01 发布,API 型号为
claude-fable-5-1;Opus 5 与旧 Fable 5 仍 Active。 - Opus 5 默认 high,支持 low、medium、high、xhigh、max;xhigh / max 不能关闭思考。
- Fable 5.1 与 Mythos 5.1 基于同一底层模型、保障机制不同;Mythos 审核限定,不是普通用户可直接选项。
- Fable/Mythos 的自适应思考不能关闭。
- Fable 5.1 支持 low、medium、high、xhigh、max;API / Claude Code 默认 high,Claude.ai / Cowork 默认 medium。
- Claude Code 的 ultracode 使用 xhigh 并组织工作流,不是高于 max 的新档;API 升级仍需检查工具调用与思考块兼容性。
- Opus 4.8 仍可用,但新任务应先比较 Opus 5;旧版连续观测不能直接当成新版成绩。
- Sonnet 5 默认启用思考但可以关闭。
- 符合条件的企业可申请 Fable ZDR,不能一概写“无 ZDR”,也不代表所有账号默认具备。
02Kimi K3、Gemini、Meta 与开放权重:怎样看新选择官方事实 + 独立测试
K3 适合网页与 React 原型、长资料、图片 / 视频理解和多步骤 Agent 任务。只是聊天先用免费入口;重要事实要回到原始来源核对,小任务也不必为了“更强”直接使用更耗额度的 K3 集群。
API 型号为 kimi-k3,上下文约 1M;缓存 / 输入 / 输出价格快照截至 2026-08-15 为 $0.30 / $3 / $15,预算前请核对官方当前价格。API 与 Kimi Code 均支持 low / high / max,默认分别为 max 与 high;Kimi Code 另有 k3-256k。集群、Websites 和动态工具属于不同产品层,不与裸 API 混算。
排名怎么读:9 月 5 日 AA v4.2 max 为 50,DeepSWE max 为 69%±5、约 $4.65 / 题。它仍是开放权重与长资料强候选,但不能由综合分推导成所有任务领先。旧 Vals、Arena 快照保留各自日期,不与当前 AA 新方法分数混算。
7 月 31 日动态复核:K3 的完整权重、技术报告和 Kimi K3 License 已正式发布;官方 Hugging Face 的 96 个权重分片合计约 1.42 TiB,因此“可自行部署”和“普通电脑能轻松运行”是两件事。CursorBench 也补入模糊多文件边界:K3 max 60.8% / $2.70,已可用但没有领先 Opus / Sol 高档位。综合前沿档与视觉专项结论不变。
K3 已成为新旗舰并发布完整权重,但 K2.7 Code 仍是更轻、更便宜的代码专项。普通版缓存 / 输入 / 输出为 $0.19 / $0.95 / $4,HighSpeed 是同一模型的高速服务,按 $0.38 / $1.90 / $8 计费。官方 Kimi Code Bench v2 从 50.9 提升到 62.0;AA v4.2 为 34(估算),不能把代码专项当成全面升级。
Kimi 官方文档 ↗官方模型卡与 Kimi Code Bench v2 ↗1.2 的 AA v4.2 xhigh 为 47;既有 DeepSWE 与 Vals 专业任务支持法律、金融与长代理专项,不代表通用前三。9 月 2 日已有 1.3,但版本不同,不能继承 1.2 的专业成绩;1.1 继续只作历史基线。
Meta 官方发布 ↗AA 当前模型页 ↗DeepSWE 长程工程 ↗AA v4.2 公共 xhigh 为 52,max 为 53;max 的准入与公开价格存在差异口径。Meta 自跑的 DeepSWE 不算第二种独立方法,当前原始榜未提供 1.3,所以先试公共 xhigh,不把它列成已证实的通用或代码冠军,也不继承 1.2 的法律金融成绩。
GLM‑5.3:AA v4.2 max 49、DeepSWE max 69%±3,已有综合与原创长程工程两种独立信号。以 100 道类似工程任务作比例示意,点估计比 Sol max 少约 4 道;误差重叠,不把它变成你真实项目的固定差距。
GLM‑5.3 Flash / Ox Alpha:AA v4.2 为 46,AA 原页未附 effort 标签;DeepSWE max 为 63%±4、平均约 $0.24 / 题,比 Sol max 点估计低 10 个百分点。它适合强模型写好计划后的低价执行;不适合独立负责模糊需求、架构、安全和最终批准。
完整 GLM‑5.3 约 753B 总参数、40B 激活,权重约 756 GB;Flash 为 320B / 18B、MIT。两者都支持 1M,但“开放权重”不等于普通电脑能流畅部署。GLM‑5.2 退到历史基线,不再参与正式推荐。
AA v4.2 high 为 51,与 Sol max 同点;Vals Index v2 为 59.17%。CursorBench xhigh 为 70.8% / $2.81,DeepSWE 当前则是 medium 67%±2 / $3.45。推理档与框架不同,四种独立方法支持低价前沿候选,不证明每种代码任务都第一。
Pro 0813:AA v4.2 max 为 42,DeepSWE max 为 63%±6、约 $1.67 / 题,继续支持低价代码专项,不支持综合超过 K3。旧 Vals SWE‑bench 已归档,不再用于判定新模型胜负。峰时 $1.32 / $3.96、非峰 $0.66 / $1.98;MIT 权重与 API 工具入口另行核对。
Flash 0731:本站仍只用 max 下结论。AA v4.2 max 为 41,42 是 Vision 分支,不能混用;DeepSWE max 为 53%±4、平均约 $0.46 / 题,旧 $0.10 不是当前账单。它适合计划明确、能自动验收的低价支线,不适合独立负责模糊需求。
Qwen 3.8 Max:正式版 AA v4.2 为 47,保留中文与云生态强候选。Qwen3.8‑Flash‑Next 已有同版本 AA v4.2 46,不再是“只有厂商成绩”;但尚缺第二种独立工程方法,因此继续观察,不用厂商自报的 DeepSWE 58.7 晋升代码主力。
当前 M 系列重点面向代码与代理任务,具备官方、AA 与 LiveBench 证据,因此进入专项和成本轨道。它使用 MiniMax Community License,商业部署需要单独核对许可条件。
MiniMax 官方模型页 ↗9 月 2 日发布的 3.8 high 在 DeepSWE 为 74%±1 / $2.36,CursorBench 为 69.2% / $2.38,两种方法支持正式工程与成本推荐。AA v4.2 high 为 47。DeepSWE 输出约 143K、166 步,说明低单价不等于低步骤或短等待;3.7 仍是效率优先对照,当前 DeepSWE medium 为 65%±3 / $2.03。两版 $0.75 / $3.75 介绍价均到 2026 年底。
查看 Gemini 3.8 资料页Google 官方模型卡 ↗对 Opus 5 / 4.8:Opus 5 的 AA v4.2 max 为 54,Vals Index v2 为 67.21%,DeepSWE max 为 74%±4。K3 在开放部署、长资料与中文产品入口仍有价值;综合指数差不是所有真实任务的固定差距。
对 Fable 5.1 / Astra / Sol:新前沿模型已有精确版本 AA、Vals 和部分工程数据;K3 不因新名称出现而失去用途,也不能沿用旧榜位置。要按任务、工作台、推理档和实际成本比较。
对 K2.6 / K2.7 Code:K3 已成为 API、Kimi Code 与开放权重能力上限;需要更低价格、更小部署体量、成熟代码专项或 K2.7 HighSpeed 时,上一代型号仍更容易控制成本和风险。
对 GLM、Qwen、DeepSeek、Grok、Gemini:GLM‑5.3 保留开放权重前沿,Grok 4.6 保留低价前沿;GLM Flash 与 DeepSeek 负责可验收的低价支线,Gemini 3.8 补入强工程与多模态,Qwen 保留中文生态。一个专项结果不能改写 K3 的全部定位。
03厂商官方成绩:看上限,也看口径厂商自报
以下保留 GPT‑5.6 与 Fable 5 等旧型号发布时的历史表,不代表 2026 年 9 月现行排名,也不属于 AA v4.2。厂商代理、工具、超时、采样和推理档不统一;Astra / Fable 5.1 的现行独立对照请看下一节。
GPT‑5.6 发布历史表
手机上可左右滑动查看完整表格
| 模型 | AA 发布时口径 | AA Code | SWE Pro | TB 2.1 |
|---|---|---|---|---|
| GPT-5.6 Sol | 58.9 | 80.0 | 64.6% | 88.8% |
| GPT-5.6 Terra | 55.0 | 77.4 | 63.4% | 87.4% |
| GPT-5.6 Luna | 51.2 | 74.6 | 62.7% | 84.7% |
Sol 的 AA 项明确为 max;SWE‑Bench Pro 与 Terminal‑Bench 页面未逐项披露完整 effort / harness。Sol Ultra 是四代理编排,不混入单模型表。
OpenAI GPT‑5.6 官方表 ↗旧版 Claude 系统卡历史表
手机上可左右滑动查看完整表格
| 模型 | SWE Pro | TB 2.1 | OSWorld | HLE + tools |
|---|---|---|---|---|
| Claude Fable 5 | 80.0% | 84.3% | 85.0% | — |
| Claude Opus 4.8 | 69.2% | 82.7% | 83.4% | 57.9% |
| Claude Sonnet 5 | 63.2% | 80.4% | 81.2% | 57.4% |
Terminal‑Bench 使用 mini‑SWE‑agent;Fable high 的 20.9% 轨迹触发安全拒答后由 Opus 4.8 接续,因此 84.3% 不是纯底模无回退分数。
Kimi Code Bench v2:K2.6 50.9 → K2.7 Code 62.0;同一官方表中 GPT‑5.5 + Codex xhigh 为 69.0、Opus 4.8 + Claude Code xhigh 为 67.4。它能证明 K2.7 的代码专项进步,但仍是厂商自建榜与不同代理组合。
Kimi 官方模型卡 ↗04同版本独立数据快照AA + Vals + CursorBench + DeepSWE
核验日期:2026-09-05。AA 于 9 月 4 日从 v4.1.1 切换为 v4.2,新增 Briefcase、GDP.pdf 等并调整权重与判分;旧分数下移不代表模型变差。综合指数、Cursor 代理得分和原创工程通过率不能相加,也不能换算成“智力提升百分比”。
AA v4.2 最高档分别是 57、55、51。Fable 5.1 的 low / medium / high / xhigh 为 48 / 50 / 52 / 54,但这四档明确是估算;max 57 是已测结果,且整组含 Opus 安全回退。Astra 与 Sol 的 low 至 max 均未标估算。不能把 Fable 的估算曲线称为完整独立实测。
CursorBench 3.2 中 Fable 5.1 low 得分 66.2、medium 68.0,跨过 Sol max 67.2;这只是 Cursor 中的得分参照。Fable max 73.4 比 xhigh 72.8 多 0.6 个百分点,平均任务费用从 $6.96 到 $9.64,约多 39%。当前未找到 Astra 的同版本 CursorBench,不能填补或外推。
9 月 3 日的 v1.1 固定 mini-swe-agent、113 个原创工程任务:Astra xhigh 74%±3 / $6.52,Sol max 73%±3 / $6.46,Opus 5 max 74%±4 / $11.84,Gemini 3.8 high 74%±1 / $2.36。区间重叠,不宣称 Astra 稳定多完成真实项目;Gemini 是强成本候选,但 143K 输出、166 步不等于最快。
Fable 5.1 没有同版本原榜记录;70%±3 是旧 Fable 5 xhigh。Grok 4.6 当前为 medium 67%±2,Gemini 3.7 为 medium 65%±3,DeepSeek Flash 0731 max 为 53%±4 / $0.46。模型、推理档和日期都必须保留。
9 月 4 日 Vals Index v2 为 Fable 5.1 68.83%、Opus 5 67.21%、Astra 66.61%、Sol 63.71%、Gemini 3.8 62.25%、Grok 4.6 59.17%。这是加权专业任务指数,不是整体经济自动化率。Fable 5.1 含 Opus 回退,发布日 67.87% 及其“回退算失败”结果不直接套用到现在的 68.83%。
Terminal-Bench 2.1 当前列 Astra max 87.27%、Sol max 85.77%、Fable 5.1 max 85.02%,使用 89 个任务与 Terminus 2。旧 SWE-bench 已于 9 月 1 日归档,不再判断新模型胜负;VibeCode 不同型号发布记录也不能一律叫当天重测。Vals 页面费用可能沿用旧 token 价,不能当今天的促销账单。
手机上可左右滑动查看完整表格
| 模型 / 站内定位 | AA v4.2 | 所示档位与估算状态 | 核验日期 / 原始来源 |
|---|---|---|---|
| Claude Fable 5.1 高难任务旗舰 | 57 | max · 含安全回退 AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GPT-6 Astra 高难任务旗舰 | 55 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Claude Opus 5 高端实用与复核 | 54 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Claude Fable 5 上一代 Fable 基线 | 53 | max · Opus 4.8 回退 AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Meta Muse Spark 1.3 新品观察 | 52 | xhigh AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GPT-5.6 Sol 成熟高端与成本路线 | 51 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Grok 4.6 低价前沿旗舰 | 51 | high AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Kimi K3 通用旗舰 · 新发布 | 50 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GLM-5.3 开放权重前沿旗舰 | 49 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Gemini 3.8 Flash 高性价比多模态执行 | 47 | high AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GPT-5.6 Terra 均衡型号 | 47 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Meta Muse Spark 1.2 法律金融与长代理专项 | 47 | xhigh AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Qwen 3.8 Max 国产强第二梯队旗舰 | 47 | 原页未标档位 AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GPT-5.5 上一代基线 | 46(估算) | xhigh AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| Claude Opus 4.8 成熟高端基线 | 46(估算) | max AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| GLM-5.3-Flash 低价合格执行者 | 46 | 原页未标档位 AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Claude Sonnet 5 均衡执行型号 | 45 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Grok 4.5 上一代 Grok 基线 | 45 | high AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Gemini 3.7 Flash 效率价值与成熟流程 | 45 | high AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| GPT-5.6 Luna 轻量高吞吐 | 43 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Meta Muse Spark 1.1 上一代代理基线 | 43(估算) | xhigh AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| GLM-5.2 上一代开放权重基线 | 43(估算) | max AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| Gemini 3.5 Flash 上一代多模态基线 | 42(估算) | high AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| DeepSeek V4 Pro 0813 低价长程代码专项 | 42 | max AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| DeepSeek V4 Flash 0731 低成本可验收候选 | 41 | max · 0731 AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Gemini 3.6 Flash 上一代 Gemini 基线 | 40 | high AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Qwen 3.7 Max 上一代千问基线 | 37(估算) | Thinking AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| Kimi K2.6 上一代通用开放权重型号 | 36(估算) | Thinking AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| MiniMax M3 国产代码与代理专项 | 36 | 未提供正式 effort AA 未标估算 | 2026-09-05 AA 原始模型页 ↗ |
| Kimi K2.7 Code Kimi 编程专项 | 34(估算) | Thinking AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
| Qwen 3.7 Plus 中文成本型号 | 31(估算) | Thinking AA 明确标注 estimated | 2026-09-05 AA 原始模型页 ↗ |
表中是该精确版本已核对的展示变体,不自动等于官方最高 effort;“估算”和“未标估算”不是相同证据等级。受限、观察和历史型号即使有分,也不自动进入正式推荐;没有取得分数的型号不按零分处理。Flash 0731 为 41,不能用 Vision 分支的 42 替代。
05API 基础价格与隐藏成本官方定价
手机上可左右滑动查看完整表格
| 模型 | 缓存读 $/M | 输入 $/M | 输出 $/M | 需要注意 |
|---|---|---|---|---|
| GPT-6 Astra | $1 | $10 | $50 | 输入 >272K:$20 / $75;API 默认 high,最高 max |
| Claude Fable 5.1 | $0.25 | $10 | $50 | 普通输入 / 输出未降;缓存读取比 Fable 5 低 75%;会员另计 |
| GPT-5.5 Pro | — | $30 | $180 | 仅 Responses API;无缓存价 |
| Fable / Mythos 5 | $1 | $10 | $50 | 旧版 API 仍 Active;Mythos 审核限定,ZDR 依企业资格 |
| Claude Opus 5 | $0.50 | $5 | $25 | 1M;默认 high;fast 模式为 $10 / $50 |
| GPT-5.6 Sol | $0.40 | $4 | $20 | 促销至少至 2026-11-21;输入 >272K:$8 / $30 |
| GPT-5.5 | $0.50 | $5 | $30 | 仍有正式 API |
| Claude Opus 4.8 | $0.50 | $5 | $25 | 成熟旧流程与连续观测基线 |
| GPT-5.6 Terra | $0.20 | $2 | $12 | 7 月 30 日降价 20%;输入 >272K:$4 / $18 |
| Claude Sonnet 5 | $0.20 | $2 | $10 | 已成为标准价格;原定 9 月涨价已取消 |
| Grok 4.6 | $0.50 | $2 | $6 | 输入 >200K:$4 / $12;四种独立信号支持低价前沿 |
| GLM-5.3 | $0.26 | $1.40 | $4.40 | 开放权重前沿;自定义许可证 |
| GLM-5.3 Flash | $0.03 | $0.15 | $0.50 | MIT;本站用长期价,五折优惠至 2026-09-09 |
| Meta Muse Spark 1.2(专项) | $0.15 | $1.25 | $4.25 | 法律、金融与可恢复长代理 |
| Meta Muse Spark 1.3 xhigh(观察) | $0.15 | $1.25 | $4.25 | 公共 xhigh 价格;max 准入与公开价格仍待确认 |
| GPT-5.6 Luna | $0.02 | $0.20 | $1.20 | 7 月 30 日降价 80%;输入 >272K:$0.40 / $1.80 |
| Gemini 3.8 / 3.7 Flash | $0.075 | $0.75 | $3.75 | 介绍价至 2026-12-31;之后 $1.50 / $7.50;存储另计 |
| Kimi K3 | $0.30 | $3 | $15 | 价格快照截至2026-08-15;预算前核对官方;1M、low / high / max |
| Kimi K2.6 | $0.16 | $0.95 | $4 | 上一代开放权重通用型号;思考模式可开关 |
| Kimi K2.7 Code | $0.19 | $0.95 | $4 | HighSpeed 为两倍价 |
| MiniMax M3 | $0.06 | $0.30 | $1.20 | >512K 为 $0.60 / $2.40;商业许可需核对 |
| Qwen 3.8 Max | ¥1.50 | ¥12 | ¥36 | 中国端人民币价;不与美元计算器混算 |
| Qwen 3.7 Plus | 按部署 | $0.40 | $1.60 | 国际端点 ≤256K;越界 $1.20 / $4.80 |
| DeepSeek V4 Pro 0813 | $0.044 | $1.32 | $3.96 | 峰时安全上限;非峰 $0.66 / $1.98;MIT 权重 |
| DeepSeek V4 Flash 0731 | $0.014 | $0.44 | $1.32 | 峰时安全上限;非峰 $0.22 / $0.66;只比较 max |
OpenAI:Astra 为 $10 / $50,输入超过 272K 后整次请求为 $20 / $75;Sol 的 $4 / $20 促销至少持续至 2026‑11‑21,越过 272K 后为 $8 / $30。API 缓存写入另计,会员额度不按这张表直接换算。
Qwen:Max 单列中国端人民币,Plus 是国际端点美元,不直接混算;不同部署可能有不同价格与阶梯,计算器只自动处理已列明的端点规则。
DeepSeek:当前别名分别映射到 Flash 0731 与 Pro 0813;表内用工作日峰时安全上限,非峰时约半价。Vision Exp 是图片输入实验分支,不是通用能力升级。
GLM:GLM‑5.3 Flash 的五折价只到 2026‑09‑09 24:00(UTC+8),因此计算器与长期预算使用 $0.15 / $0.50 的 list price。
Anthropic:1M 没有同类溢价;Fable 5.1 普通输入 / 输出仍为 $10 / $50,只有缓存读取从 $1 降至 $0.25。相对 Opus 5 哪个更省取决于缓存和输出构成,不能概括为全部便宜或全部两倍价。Sonnet 5 的 $2 / $10 已是标准价。
真正成本:挂牌价 × token 只是基础;还要加上思考冗长度、失败重试、工具调用和代理循环。
06为什么不同榜单会得出相反结论?方法解释
测试对象可能不同
- 基础模型不等于 Codex、Claude Code、Cursor 或 Terminus 代理。
- 同一模型换工具、系统提示、超时和 token 上限,结果会显著变化。
- max 与 high 的算力预算不同,不能解释成纯粹模型 IQ。
题目与评分也不同
- 公开题容易污染;私有题更抗污染,但外界无法完整复现。
- LLM 裁判适合开放任务,却会引入风格和评分模型偏见。
- 人类偏好榜更喜欢语气、格式和长度,不代表答案更正确。
最终结论
四条最终建议
只选一个
前沿质量优先比较 Astra 与 Fable 5.1;成熟项目保留 Sol / Opus 5 的稳定流程,有验收的低价执行再试 Gemini 3.8。
两个模型要分角色
让 Fable 5.1 或 Astra 写清目标和验收,再按具体能力拆分执行;另一家只审关键遗漏,不重复整份工作。先看真实任务与档位对照 →
预算看成功任务成本
需要较强判断又想省钱,先小测 Grok 4.6;强模型已写清计划、有机器测试的支线可试 GLM‑5.3 Flash max,另一条代码路线再看 DeepSeek Pro max。把重试、等待和人工返工一起算。
多模态和开放部署分开选
音视频与 Google 工具先看 Gemini 3.8,长 PDF 的高质量阅读也比较 Astra。开放权重前沿可比较 GLM‑5.3 与 K3,但需要大型推理基础设施;低成本服务先用 GLM‑5.3 Flash 等 API 验证真实任务。
Astra 做工程闭环,Fable 5.1 交叉复核:Astra / Fable 5.1 先从 high 开始;难题或返工代价高时可直接 xhigh/max。Fable 的 AA 中低档是估算,选择档位同时看 Cursor 实测。
重新选择 ↑