模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

OpenAI高难任务旗舰核验 2026-09-05

GPT-6 Astra

复杂推理、代码与终端闭环、资料分析、少返工的端到端任务

已有跨来源证据

AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。

AA v4.255 · max · 原页未标估算 · 核验 2026-09-05

上下文
1.05M
默认推理
high
API 输入
$10 / M
API 输出
$50 / M
开放权重
判断把握
中高

同一方法内对照,不把型号换算成智商

Astra 各档大致对应 Sol 的哪一档

综合题中,Astra low 接近 Sol high—xhigh,medium 已到 Sol max 的邻近区间;长程代码则是 Astra xhigh 与 Sol max 同一领先档。这个对应只在各自评测中成立,不能拿来保证所有工作都少开两档。
AA v4.2 · 综合能力五档low 49 · medium 52 · high 53 · xhigh 54 · max 55
熟悉的参照Sol:low 41 · medium 46 · high 48 · xhigh 50 · max 51

Astra low 落在 Sol high 与 xhigh 之间;medium 比 Sol max 高 1 个指数点,先按邻近档理解。high 及以上高于此次 Sol 最高展示点,但指数点不是成功率。

DeepSWE v1.1 · 固定代理长程工程Astra xhigh 74%±3 · $6.52 / 题
熟悉的参照Sol max 73%±3 · $6.46 / 题

113 个原创任务、同一 mini-swe-agent;误差区间重叠。Astra 约 30K 输出、29 步,Sol 约 60K、61 步,显示这一框架中更少输出和步骤,而非证明所有项目更快。

Vals · 2026-09-05 max 快照Astra 66.61%±1.09
熟悉的参照Sol 63.71%±1.06 · Fable 5.1 含回退 68.83%±1.08

这套专业任务的点估计与 AA 顺序相近,但不是同一把尺。Vals 的旧单价与当前 API 促销可能不同,页面每题费用不能直接当今天发票。

官方 API · 最高档与价格单模型最高 max;标准输入 $10 / 输出 $50
熟悉的参照Ultra 多代理不等于 max;>272K 输入另有长上下文价

推理档越高可能产生更多 token;同一挂牌价不等于同一任务成本。超过 272K 输入时整请求输入与缓存翻倍、输出为 1.5 倍;工具调用使用 Responses API。

怎么实际使用

要一次做对、跨模块推理或难终端问题,可先试 high;难题再升 xhigh / max。若任务易验收,用 low / medium 与现有 Sol 做同题 A/B,记录完成率、返工和总费用后再替换。

不要怎样误读

AA 于 9 月 4 日更新至 v4.2,不能与旧 v4.1.1 分数混排;截至9月5日,CursorBench 尚无 Astra 同版本数据,也没有 Ultra 与单模型 max 的受控对照。

证据快照:2026-09-05 · AA v4.2 / DeepSWE v1.1

集中查看

这个模型的主要判断

综合能力

AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。

实际编程

DeepSWE:xhigh 74%±3、Sol max 73%±3,同一领先档;Astra 输出约少一半、步骤约少一半,两者单题费用约 $6.5。

使用限制

API 最高单模型 effort 是 max,Ultra 多代理没有同口径成绩;工具调用需 Responses API。刚发布的长期稳定性仍需实际项目检验。

当前状态

已有跨来源证据,最近核验 2026-09-05

价格口径

标准 API 每百万 Token;>272K 输入时整请求输入/缓存翻倍、输出 1.5 倍;缓存写入为普通输入 1.25 倍。Batch/Flex 半价,Fast 2 倍;会员额度另计。

直接核对

本页的关键来源

官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。