已核对 high 配置;与 Sol max 同点只代表综合题接近,不代表所有 effort 都同样强。旧 60.9 属 v4.1.1,不能混列。
xAI低价前沿旗舰核验 2026-08-15
Grok 4.6
低价前沿编程、工具代理、知识工作,以及需要 X 搜索的实时信息调研
AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。
AA v4.2:51 · high · 原页未标估算 · 核验 2026-09-05
- 上下文
- 500K
- 默认推理
- high
- API 输入
- $2 / M
- API 输出
- $6 / M
- 开放权重
- 否
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。新模型先给区间,不抢报唯一冠军
Grok 4.6 目前相当于哪个常用档位
一句话:Grok 4.6 仍是低价强档:AA v4.2 与 Sol max 同点,Cursor 模糊多文件表现更突出;DeepSWE 当前记录为 medium 67%,不是旧文案的 xhigh。新版 Fable 5.1 / Astra 出现后,它也不是每种任务都第一。当前专业任务点估计低于 Sol 与 Opus。旧 71.82% 是不同快照;此次变动细节未充分披露,不能把分差直接解释成模型降智。
在 Cursor 的真实多文件会话里,medium 接近 Sol max,high / xhigh 接近 Opus 5 max;与 Fable 5.1 最高档仍有差距。小差距不制造稳定冠军。
换成一批更长、更陌生的仓库任务后,Grok 不再独占最高点,而是和 GPT-5.5 xhigh、Luna max、K3 落在相邻区间。100 道类似题的点估计比 Sol / Opus 少约 6~7 道,但误差仍要一起看。
日常强任务可先试 high;模糊多文件任务确实更难、high 失败后再升 xhigh。需要 X 上一手帖子时,Grok 还有入口优势,但搜到原帖不等于自动验证了事实。
AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,但它们分别测综合推理、专业任务、模糊多文件和原创长程工程。网页因此把 Grok 写成低价前沿候选,不把任一单榜改写成通用 IQ 或永久冠军。
证据快照:2026-09-05 · AA v4.2 / 当前 DeepSWE
集中查看
这个模型的主要判断
AA v4.2 high 51,与 Sol max 同分;xhigh 49 并非更高。Vals Index v2 为 59.17%,显示专业任务表现不能由综合分直接外推。
CursorBench xhigh 70.8% / $2.81;DeepSWE 最佳 medium 67%±2% / $3.45,低于 Astra/Sol 点估计。两方法支持低价工程候选,不支持所有任务第一。
AA、Vals、CursorBench 与 DeepSWE 已形成四种独立信号,支持“前沿档且价格突出”,不支持“所有任务第一”。输入超过 200K 后整次请求按 $4 / $12 计费;事实性、长期无人值守和发布初期稳定性仍要单独复核。
2026-08-12 发布;API、Grok Build 与部分第三方开发工具已可用
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。