模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

xAI低价前沿旗舰核验 2026-08-15

Grok 4.6

低价前沿编程、工具代理、知识工作,以及需要 X 搜索的实时信息调研

已有跨来源证据

AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。

AA v4.251 · high · 原页未标估算 · 核验 2026-09-05

上下文
500K
默认推理
high
API 输入
$2 / M
API 输出
$6 / M
开放权重
判断把握
中高

新模型先给区间,不抢报唯一冠军

Grok 4.6 目前相当于哪个常用档位

一句话:Grok 4.6 仍是低价强档:AA v4.2 与 Sol max 同点,Cursor 模糊多文件表现更突出;DeepSWE 当前记录为 medium 67%,不是旧文案的 xhigh。新版 Fable 5.1 / Astra 出现后,它也不是每种任务都第一。
AA v4.2 · 综合推理Grok 4.6 high 51
熟悉的参照Sol max 51 · Opus 5 max 54 · Astra max 55

已核对 high 配置;与 Sol max 同点只代表综合题接近,不代表所有 effort 都同样强。旧 60.9 属 v4.1.1,不能混列。

Vals Index · 2026-09-05 当前快照59.17%±1.21
熟悉的参照Sol 63.71%±1.06 · Opus 5 67.21%±0.98

当前专业任务点估计低于 Sol 与 Opus。旧 71.82% 是不同快照;此次变动细节未充分披露,不能把分差直接解释成模型降智。

CursorBench 3.2 · 模糊多文件medium 67.1% · high 69.9% · xhigh 70.8%
熟悉的参照Sol max 67.2% · Opus 5 max 70.0% · Fable 5.1 high 69.4% / max 73.4%

在 Cursor 的真实多文件会话里,medium 接近 Sol max,high / xhigh 接近 Opus 5 max;与 Fable 5.1 最高档仍有差距。小差距不制造稳定冠军。

DeepSWE · 原创长程工程medium 67%±2 · $3.45 / 题
熟悉的参照GPT-5.5 xhigh / Luna max 67% · K3 69%±5 · Sol max 73%±3 · Opus 5 max 74%±4

换成一批更长、更陌生的仓库任务后,Grok 不再独占最高点,而是和 GPT-5.5 xhigh、Luna max、K3 落在相邻区间。100 道类似题的点估计比 Sol / Opus 少约 6~7 道,但误差仍要一起看。

怎么实际使用

日常强任务可先试 high;模糊多文件任务确实更难、high 失败后再升 xhigh。需要 X 上一手帖子时,Grok 还有入口优势,但搜到原帖不等于自动验证了事实。

不要怎样误读

AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,但它们分别测综合推理、专业任务、模糊多文件和原创长程工程。网页因此把 Grok 写成低价前沿候选,不把任一单榜改写成通用 IQ 或永久冠军。

证据快照:2026-09-05 · AA v4.2 / 当前 DeepSWE

集中查看

这个模型的主要判断

综合能力

AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。

实际编程

CursorBench xhigh 70.8% / $2.81;DeepSWE 最佳 medium 67%±2% / $3.45,低于 Astra/Sol 点估计。两方法支持低价工程候选,不支持所有任务第一。

使用限制

AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,支持“前沿档且价格突出”,不支持“所有任务第一”。输入超过 200K 后整次请求按 $4 / $12 计费;事实性、长期无人值守和发布初期稳定性仍要单独复核。

当前状态

2026-08-12 发布;API、Grok Build 与部分第三方开发工具已可用