Astra low 落在 Sol high 与 xhigh 之间;medium 比 Sol max 高 1 个指数点,先按邻近档理解。high 及以上高于此次 Sol 最高展示点,但指数点不是成功率。
OpenAI高难任务旗舰核验 2026-09-05
GPT-6 Astra
复杂推理、代码与终端闭环、资料分析、少返工的端到端任务
AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
AA v4.2:55 · max · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1.05M
- 默认推理
- high
- API 输入
- $10 / M
- API 输出
- $50 / M
- 开放权重
- 否
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。DeepSWE xhigh 74%±3、Vals 终端 max 87.27%,支持长链路实现与验证。
较强:同口径仓库任务 · 判断把握 高实施候选大型重构与技术迁移终端和固定框架长程工程证据支持把计划变成可运行改动。
中等:编程分榜与工程方法交叉 · 判断把握 中高工程复核候选代码审查与上线前复核可利用终端与长程工程能力重新验证实现;这是任务迁移判断,不是已测审查冠军。
中等:长任务表现与交叉复核方法 · 判断把握 中高首选候选终端、DevOps 与长链路执行当前同框架终端点估计领先,并有 DeepSWE 长程工程交叉支持。
较强:同口径终端任务 · 判断把握 高成品与工程候选从一句需求做完整应用当前 VibeCode 原页为 89.59%,另有终端与长程工程证据。
较强:完整应用 + 模糊多文件任务 · 判断把握 高视觉与工程候选前端视觉、动效与响应式当前 VibeCode 为 89.59%,适合把成品与后续工程验收一起比较。
中高:Arena WebDev / React 初榜 + 应用分榜 · 判断把握 中高同一方法内对照,不把型号换算成智商
Astra 各档大致对应 Sol 的哪一档
综合题中,Astra low 接近 Sol high—xhigh,medium 已到 Sol max 的邻近区间;长程代码则是 Astra xhigh 与 Sol max 同一领先档。这个对应只在各自评测中成立,不能拿来保证所有工作都少开两档。113 个原创任务、同一 mini-swe-agent;误差区间重叠。Astra 约 30K 输出、29 步,Sol 约 60K、61 步,显示这一框架中更少输出和步骤,而非证明所有项目更快。
这套专业任务的点估计与 AA 顺序相近,但不是同一把尺。Vals 的旧单价与当前 API 促销可能不同,页面每题费用不能直接当今天发票。
推理档越高可能产生更多 token;同一挂牌价不等于同一任务成本。超过 272K 输入时整请求输入与缓存翻倍、输出为 1.5 倍;工具调用使用 Responses API。
要一次做对、跨模块推理或难终端问题,可先试 high;难题再升 xhigh / max。若任务易验收,用 low / medium 与现有 Sol 做同题 A/B,记录完成率、返工和总费用后再替换。
AA 于 9 月 4 日更新至 v4.2,不能与旧 v4.1.1 分数混排;截至9月5日,CursorBench 尚无 Astra 同版本数据,也没有 Ultra 与单模型 max 的受控对照。
证据快照:2026-09-05 · AA v4.2 / DeepSWE v1.1
集中查看
这个模型的主要判断
AA v4.2:low 49 落在 Sol high 48 / xhigh 50 之间;medium 52 邻近 Sol max 51,high 53 至 max 55 更高。只作该题集参照,不换算智力百分比。
DeepSWE:xhigh 74%±3、Sol max 73%±3,同一领先档;Astra 输出约少一半、步骤约少一半,两者单题费用约 $6.5。
API 最高单模型 effort 是 max,Ultra 多代理没有同口径成绩;工具调用需 Responses API。刚发布的长期稳定性仍需实际项目检验。
已有跨来源证据,最近核验 2026-09-05
标准 API 每百万 Token;>272K 输入时整请求输入/缓存翻倍、输出 1.5 倍;缓存写入为普通输入 1.25 倍。Batch/Flex 半价,Fast 2 倍;会员额度另计。
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。