综合题落在 Sol medium 与 high 之间,不是所有工作都等于其中一档。旧 v4.1.1 为 58.1,方法换版不能当成能力突然下降。
Alibaba国产强第二梯队旗舰核验 2026-08-29
Qwen 3.8 Max
中文复杂任务、视觉与长上下文、阿里云生态,以及需要统一国内 API 入口的团队
AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。
AA v4.2:47 · 原页未标档位 · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- Thinking
- API 输入
- 见下方价格口径
- API 输出
- 见下方价格口径
- 开放权重
- 否
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。用熟悉的模型做参照
Qwen 3.8 Max 到底相当于哪个档位
一句话:AA v4.2 综合分落在 Sol medium—high 之间;旧长程代码记录则更接近 Sonnet 5 / GPT-5.4 的区间。不同任务的参照会变化,不能继续用旧 AA 档位换算今天的全部能力。会在终端里做事,不等于事实判断同样可靠。Qwen 的终端差距不算悬殊,但知识题差距很大,资料型结论仍要强制给来源。
该次专业任务更接近当时的 Terra 和 GPT-5.5。保留历史意义,不与 9 月当前 Vals Index 数值混排。
当前记录约 95K 输出、111 步,和 Sonnet 5 max / GPT-5.4 xhigh 的误差重叠,低于 Luna max / GPT-5.5 xhigh 的点位;不能由综合指数接近推断工程同样稳。
9 月 4 日前端偏好初榜已有同版结果,与旧 Max 的 1670±12 区间重叠;尚不足推断综合或长程工程升级。API 别名可能变化,记录实际版本;不继承 8 月 3 日的旧分。
已有综合测量与前端偏好,不再称只有厂商成绩。缺少同版独立长程仓库结果,继续低价与前端观察;厂商自测 DeepSWE 58.7 不替代独立原榜。
中文、视觉、长上下文和阿里云生态是它更现实的购买理由。普通中文复杂任务可从默认混合思考开始;重要仓库任务仍要测试兜底,并用 Sol / Opus 做高风险规划或终审。
不存在唯一“相当于 GPT 几点几”。旧测固定为当时版本;0902 与 Flash-Next 已有各自新信号,但前端偏好不能继承成旧 Max 的综合/长程代码成绩,也不自动成为生产工程冠军。
证据快照:2026-09-05;旧单项与 Vals 标注 8 月历史
集中查看
这个模型的主要判断
AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。
DeepSWE xhigh 为 57%±3,和 Sonnet 5 max 54%±4、GPT-5.4 xhigh 52%±2 的区间更接近;明显低于 Luna max / GPT-5.5 xhigh 的 67%,不应按 Sol xhigh 估计长程代码
正式版已有三类独立信号,但没有证明它在通用能力或成功任务成本上胜过同价位前沿模型。Qwen3.8-Flash-Next 只保留观察;中国端点人民币价与第三方美元报价必须分开看。
本页主体为 2026-08-03 正式版。另有 Max 0902 修订及 Flash-Next 观察:0902 有初步 WebDev,Flash-Next 有 AA 与初步 WebDev;缺同版独立长程工程,不继承旧分或自动升级正式结论。
中国端点当前为输入 ¥12 / M、输出 ¥36 / M、缓存命中 ¥1.50 / M;本站美元计算器不混用人民币价格