跳到对比工具
模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

34 个资料项 · 25 个进入比较轨道

把真正关心的模型放到一起比较

一次选择 2—4 个模型,对照能力、编程、推理强度、价格、上下文和使用限制。没有账户,也不会调用模型。

第一次比较:先选“日常实用”,只放入 2 个模型,看结论和限制。

需要技术细节:再切到旗舰或成本轨道,核对推理档、上下文与 API 单价。

第一步

先确定你要比较的问题

四条轨道使用不同标准。切换轨道会载入一组适合该问题的默认模型,你仍可以从全部已收录模型中替换。
旗舰上限怎么比较

只比较版本明确、公开可用的通用旗舰最佳已测配置;最高得分不总在最高推理档。AA 估算和 Ultra 多代理不混入正式榜。

第二步

选择 2—4 个模型

已选择 4 个。第一个模型是手机端的固定基准;跨轨模型只作参考,不强行判定输赢。

适合本轨直接比较

查看其他已收录模型(28 个)

这些模型不属于当前轨道的直接比较范围,选中后会明确标为“跨轨参考”。

对比结果

把差异放在同一张表里

这里提供证据对照,不自动宣布“全能冠军”。不同任务、预算和推理强度会改变最终选择。

在较窄的电脑窗口中可左右滑动查看完整矩阵。

比较项目Fable 5.1Anthropic · 基准模型AstraOpenAI · 高难任务旗舰Grok 4.6xAI · 低价前沿旗舰Kimi K3Moonshot · 通用旗舰 · 新发布
本轨结论只解释当前轨道关心的问题,不作为全能总排名。
AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。
AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。
AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。
比较口径跨轨模型仍可查看,但不能与本轨模型直接判定高低。
适合本轨直接比较
适合本轨直接比较
适合本轨直接比较
适合本轨直接比较
模型定位厂商、产品角色及是否为当前旗舰。
Anthropic高难任务旗舰 · 当前旗舰
OpenAI高难任务旗舰 · 当前旗舰
xAI低价前沿旗舰 · 当前旗舰
Moonshot通用旗舰 · 新发布 · 当前旗舰
综合推理证据AA v4.2 与 Vals v2 使用不同方法,不能把两项简单相加;估算分不等同实测。
AA v4.257max · 含安全回退 · 2026-09-05Vals v2:68.83
AA v4.255max · 2026-09-05Vals v2:66.61
AA v4.251high · 2026-09-05Vals v2:59.17
AA v4.250max · 2026-09-05Vals v2:暂无已核实的同版本分数
实际编程代码题、仓库修复和完整应用是不同能力。
CursorBench 3.2:max 73.4%、xhigh 72.8%;最高档仅多 0.6 个百分点却贵约 39%,日常先 high,难题再 xhigh/max。
DeepSWE:xhigh 74%±3、Sol max 73%±3,同一领先档;Astra 输出约少一半、步骤约少一半,两者单题费用约 $6.5。
CursorBench xhigh 70.8% / $2.81;DeepSWE 最佳 medium 67%±2% / $3.45,低于 Astra/Sol 点估计。两方法支持低价工程候选,不支持所有任务第一。
DeepSWE 为 69%±5,与 Opus、Sol、Fable、Terra 的区间重叠;CursorBench max 为 60.8% / $2.70,低于 Opus、Sol 高档位。完整应用和网页专项突出,但终端与网络安全并非首选
适合做什么基于本报告证据给出的主要使用场景。
高难规划、含糊多文件实现、长程专业工作与异家复核
复杂推理、代码与终端闭环、资料分析、少返工的端到端任务
低价前沿编程、工具代理、知识工作,以及需要 X 搜索的实时信息调研
网页与 React 原型、长资料、并行调研、图片 / 视频理解、长程 Agent,以及具备大型推理基础设施的开放权重部署
推理强度默认档适合日常;最高档不一定最划算。
默认:high单模型最高:max
默认:high单模型最高:max
默认:high单模型最高:xhigh
默认:max单模型最高:max
API 挂牌价美元/百万 token,不是 ChatGPT、Claude 等 App 会员费。
输入 $10 · 输出 $50缓存输入 $0.25标准 API 每百万 Token;缓存读取 $0.25,5 分钟缓存写入 $12.50,1 小时写入 $20。会员额度另计。
输入 $10 · 输出 $50缓存输入 $1标准 API 每百万 Token;>272K 输入时整请求输入/缓存翻倍、输出 1.5 倍;缓存写入为普通输入 1.25 倍。Batch/Flex 半价,Fast 2 倍;会员额度另计。
输入 $2 · 输出 $6缓存输入 $0.5
输入 $3 · 输出 $15缓存输入 $0.3官方统一价;100 万上下文不另设长上下文阶梯
上下文与部署上下文表示单次最多能处理的内容量;开放权重不等于免费运行。
1M 上下文闭源服务
1.05M 上下文闭源服务
500K 上下文闭源服务
1M 上下文开放权重 · Kimi K3 License(商业使用有条件)
限制与风险使用前最容易忽略、却可能影响最终成本或结果的事项。
AA 与 Vals 使用默认安全回退,不能视为纯 Fable 无回退成绩;新版本长程实战与独立 DeepSWE 仍待补。
API 最高单模型 effort 是 max,Ultra 多代理没有同口径成绩;工具调用需 Responses API。刚发布的长期稳定性仍需实际项目检验。
AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,支持“前沿档且价格突出”,不支持“所有任务第一”。输入超过 200K 后整次请求按 $4 / $12 计费;事实性、长期无人值守和发布初期稳定性仍要单独复核。2026-08-12 发布;API、Grok Build 与部分第三方开发工具已可用
重要事实必须回到来源核对;短任务不必开集群,日常 Code 先用 k3-256k + high。1M 档通常约消耗 2 倍额度,高速模式约 3 倍额度;官方权重约 1.42 TiB,不是普通个人电脑可轻松部署的模型。网页、App、Agent、K3 集群、Kimi Code 和开发者 API 均已上线;2026-07-27 已发布完整权重、技术报告和 Kimi K3 License
证据状态把握表示本报告的判断把握,不是模型正确率。
已核验 · 把握 中高核验日期 2026-09-05
已核验 · 把握 中高核验日期 2026-09-05
已核验 · 把握 中高核验日期 2026-08-15
已核验 · 把握 中高核验日期 2026-08-15
Fable 5.1 对比
Fable 5.1固定基准
Astra当前候选
本轨结论只解释当前轨道关心的问题,不作为全能总排名。
Fable 5.1
AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。
Astra
AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
比较口径跨轨模型仍可查看,但不能与本轨模型直接判定高低。
Fable 5.1
适合本轨直接比较
Astra
适合本轨直接比较
模型定位厂商、产品角色及是否为当前旗舰。
Fable 5.1
Anthropic高难任务旗舰 · 当前旗舰
Astra
OpenAI高难任务旗舰 · 当前旗舰
综合推理证据AA v4.2 与 Vals v2 使用不同方法,不能把两项简单相加;估算分不等同实测。
Fable 5.1
AA v4.257max · 含安全回退 · 2026-09-05Vals v2:68.83
Astra
AA v4.255max · 2026-09-05Vals v2:66.61
实际编程代码题、仓库修复和完整应用是不同能力。
Fable 5.1
CursorBench 3.2:max 73.4%、xhigh 72.8%;最高档仅多 0.6 个百分点却贵约 39%,日常先 high,难题再 xhigh/max。
Astra
DeepSWE:xhigh 74%±3、Sol max 73%±3,同一领先档;Astra 输出约少一半、步骤约少一半,两者单题费用约 $6.5。
适合做什么基于本报告证据给出的主要使用场景。
Fable 5.1
高难规划、含糊多文件实现、长程专业工作与异家复核
Astra
复杂推理、代码与终端闭环、资料分析、少返工的端到端任务
推理强度默认档适合日常;最高档不一定最划算。
Fable 5.1
默认:high单模型最高:max
Astra
默认:high单模型最高:max
API 挂牌价美元/百万 token,不是 ChatGPT、Claude 等 App 会员费。
Fable 5.1
输入 $10 · 输出 $50缓存输入 $0.25标准 API 每百万 Token;缓存读取 $0.25,5 分钟缓存写入 $12.50,1 小时写入 $20。会员额度另计。
Astra
输入 $10 · 输出 $50缓存输入 $1标准 API 每百万 Token;>272K 输入时整请求输入/缓存翻倍、输出 1.5 倍;缓存写入为普通输入 1.25 倍。Batch/Flex 半价,Fast 2 倍;会员额度另计。
上下文与部署上下文表示单次最多能处理的内容量;开放权重不等于免费运行。
Fable 5.1
1M 上下文闭源服务
Astra
1.05M 上下文闭源服务
限制与风险使用前最容易忽略、却可能影响最终成本或结果的事项。
Fable 5.1
AA 与 Vals 使用默认安全回退,不能视为纯 Fable 无回退成绩;新版本长程实战与独立 DeepSWE 仍待补。
Astra
API 最高单模型 effort 是 max,Ultra 多代理没有同口径成绩;工具调用需 Responses API。刚发布的长期稳定性仍需实际项目检验。
证据状态把握表示本报告的判断把握,不是模型正确率。
Fable 5.1
已核验 · 把握 中高核验日期 2026-09-05
Astra
已核验 · 把握 中高核验日期 2026-09-05
这个页面不会调用 AI

所有内容来自当前报告的数据快照,由浏览器本地完成筛选和排版;选择结果只写入当前网址,不会上传账户信息。