AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。
AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
34 个资料项 · 25 个进入比较轨道
第一次比较:先选“日常实用”,只放入 2 个模型,看结论和限制。
需要技术细节:再切到旗舰或成本轨道,核对推理档、上下文与 API 单价。
第一步
只比较版本明确、公开可用的通用旗舰最佳已测配置;最高得分不总在最高推理档。AA 估算和 Ultra 多代理不混入正式榜。
第二步
这些模型不属于当前轨道的直接比较范围,选中后会明确标为“跨轨参考”。
对比结果
在较窄的电脑窗口中可左右滑动查看完整矩阵。
| 比较项目 | Fable 5.1Anthropic · 基准模型 | AstraOpenAI · 高难任务旗舰 | Grok 4.6xAI · 低价前沿旗舰 | Kimi K3Moonshot · 通用旗舰 · 新发布 |
|---|---|---|---|---|
| 本轨结论只解释当前轨道关心的问题,不作为全能总排名。 | AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。 | AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。 | AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。 | AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。 |
| 比较口径跨轨模型仍可查看,但不能与本轨模型直接判定高低。 | 适合本轨直接比较 | 适合本轨直接比较 | 适合本轨直接比较 | 适合本轨直接比较 |
| 模型定位厂商、产品角色及是否为当前旗舰。 | Anthropic高难任务旗舰 · 当前旗舰 | OpenAI高难任务旗舰 · 当前旗舰 | xAI低价前沿旗舰 · 当前旗舰 | Moonshot通用旗舰 · 新发布 · 当前旗舰 |
| 综合推理证据AA v4.2 与 Vals v2 使用不同方法,不能把两项简单相加;估算分不等同实测。 | AA v4.2:57max · 含安全回退 · 2026-09-05Vals v2:68.83 | AA v4.2:55max · 2026-09-05Vals v2:66.61 | AA v4.2:51high · 2026-09-05Vals v2:59.17 | AA v4.2:50max · 2026-09-05Vals v2:暂无已核实的同版本分数 |
| 实际编程代码题、仓库修复和完整应用是不同能力。 | CursorBench 3.2:max 73.4%、xhigh 72.8%;最高档仅多 0.6 个百分点却贵约 39%,日常先 high,难题再 xhigh/max。 | DeepSWE:xhigh 74%±3、Sol max 73%±3,同一领先档;Astra 输出约少一半、步骤约少一半,两者单题费用约 $6.5。 | CursorBench xhigh 70.8% / $2.81;DeepSWE 最佳 medium 67%±2% / $3.45,低于 Astra/Sol 点估计。两方法支持低价工程候选,不支持所有任务第一。 | DeepSWE 为 69%±5,与 Opus、Sol、Fable、Terra 的区间重叠;CursorBench max 为 60.8% / $2.70,低于 Opus、Sol 高档位。完整应用和网页专项突出,但终端与网络安全并非首选 |
| 适合做什么基于本报告证据给出的主要使用场景。 | 高难规划、含糊多文件实现、长程专业工作与异家复核 | 复杂推理、代码与终端闭环、资料分析、少返工的端到端任务 | 低价前沿编程、工具代理、知识工作,以及需要 X 搜索的实时信息调研 | 网页与 React 原型、长资料、并行调研、图片 / 视频理解、长程 Agent,以及具备大型推理基础设施的开放权重部署 |
| 推理强度默认档适合日常;最高档不一定最划算。 | 默认:high单模型最高:max | 默认:high单模型最高:max | 默认:high单模型最高:xhigh | 默认:max单模型最高:max |
| API 挂牌价美元/百万 token,不是 ChatGPT、Claude 等 App 会员费。 | 输入 $10 · 输出 $50缓存输入 $0.25标准 API 每百万 Token;缓存读取 $0.25,5 分钟缓存写入 $12.50,1 小时写入 $20。会员额度另计。 | 输入 $10 · 输出 $50缓存输入 $1标准 API 每百万 Token;>272K 输入时整请求输入/缓存翻倍、输出 1.5 倍;缓存写入为普通输入 1.25 倍。Batch/Flex 半价,Fast 2 倍;会员额度另计。 | 输入 $2 · 输出 $6缓存输入 $0.5 | 输入 $3 · 输出 $15缓存输入 $0.3官方统一价;100 万上下文不另设长上下文阶梯 |
| 上下文与部署上下文表示单次最多能处理的内容量;开放权重不等于免费运行。 | 1M 上下文闭源服务 | 1.05M 上下文闭源服务 | 500K 上下文闭源服务 | 1M 上下文开放权重 · Kimi K3 License(商业使用有条件) |
| 限制与风险使用前最容易忽略、却可能影响最终成本或结果的事项。 | AA 与 Vals 使用默认安全回退,不能视为纯 Fable 无回退成绩;新版本长程实战与独立 DeepSWE 仍待补。 | API 最高单模型 effort 是 max,Ultra 多代理没有同口径成绩;工具调用需 Responses API。刚发布的长期稳定性仍需实际项目检验。 | AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,支持“前沿档且价格突出”,不支持“所有任务第一”。输入超过 200K 后整次请求按 $4 / $12 计费;事实性、长期无人值守和发布初期稳定性仍要单独复核。2026-08-12 发布;API、Grok Build 与部分第三方开发工具已可用 | 重要事实必须回到来源核对;短任务不必开集群,日常 Code 先用 k3-256k + high。1M 档通常约消耗 2 倍额度,高速模式约 3 倍额度;官方权重约 1.42 TiB,不是普通个人电脑可轻松部署的模型。网页、App、Agent、K3 集群、Kimi Code 和开发者 API 均已上线;2026-07-27 已发布完整权重、技术报告和 Kimi K3 License |
| 证据状态把握表示本报告的判断把握,不是模型正确率。 | 已核验 · 把握 中高核验日期 2026-09-05 | 已核验 · 把握 中高核验日期 2026-09-05 | 已核验 · 把握 中高核验日期 2026-08-15 | 已核验 · 把握 中高核验日期 2026-08-15 |