模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Alibaba国产强第二梯队旗舰核验 2026-08-29

Qwen 3.8 Max

中文复杂任务、视觉与长上下文、阿里云生态,以及需要统一国内 API 入口的团队

已有跨来源证据

AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。

AA v4.247 · 原页未标档位 · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
Thinking
API 输入
见下方价格口径
API 输出
见下方价格口径
开放权重
判断把握
中高

用熟悉的模型做参照

Qwen 3.8 Max 到底相当于哪个档位

一句话:AA v4.2 综合分落在 Sol medium—high 之间;旧长程代码记录则更接近 Sonnet 5 / GPT-5.4 的区间。不同任务的参照会变化,不能继续用旧 AA 档位换算今天的全部能力。
AA v4.2 · 综合推理Qwen 3.8 Max 47
熟悉的参照Sol medium 46 · high 48 · Gemini 3.8 high 47

综合题落在 Sol medium 与 high 之间,不是所有工作都等于其中一档。旧 v4.1.1 为 58.1,方法换版不能当成能力突然下降。

2026-08-13 历史 · AA v4.1.1 单项终端 81.3% · 知识 31.9%
熟悉的参照Sol medium 86.1% · 57.8%

会在终端里做事,不等于事实判断同样可靠。Qwen 的终端差距不算悬殊,但知识题差距很大,资料型结论仍要强制给来源。

2026-08-13 历史 · Vals Index65.47%±1.63
熟悉的参照Terra 65.14% · GPT-5.5 67.95% · Sol 73.12%

该次专业任务更接近当时的 Terra 和 GPT-5.5。保留历史意义,不与 9 月当前 Vals Index 数值混排。

2026-09-05 · DeepSWE v1.1xhigh 57%±3 · $3.73 / 题
熟悉的参照Sonnet 5 max 54%±4 · GPT-5.4 xhigh 52%±2 · Luna max / GPT-5.5 xhigh 67%

当前记录约 95K 输出、111 步,和 Sonnet 5 max / GPT-5.4 xhigh 的误差重叠,低于 Luna max / GPT-5.5 xhigh 的点位;不能由综合指数接近推断工程同样稳。

2026-09-04 官方价目 · 0902 新修订qwen3.8-max-0902 · International $2 / $6 · ≤1M
熟悉的参照Arena WebDev 1689±17 · Preliminary · 1,769 票

9 月 4 日前端偏好初榜已有同版结果,与旧 Max 的 1670±12 区间重叠;尚不足推断综合或长程工程升级。API 别名可能变化,记录实际版本;不继承 8 月 3 日的旧分。

Flash-Next · 两种新证据,分开看用途AA v4.2 46;Arena WebDev 1625±14
熟悉的参照WebDev Preliminary · 2,112 票;并非 Max 0902

已有综合测量与前端偏好,不再称只有厂商成绩。缺少同版独立长程仓库结果,继续低价与前端观察;厂商自测 DeepSWE 58.7 不替代独立原榜。

怎么实际使用

中文、视觉、长上下文和阿里云生态是它更现实的购买理由。普通中文复杂任务可从默认混合思考开始;重要仓库任务仍要测试兜底,并用 Sol / Opus 做高风险规划或终审。

不要怎样误读

不存在唯一“相当于 GPT 几点几”。旧测固定为当时版本;0902 与 Flash-Next 已有各自新信号,但前端偏好不能继承成旧 Max 的综合/长程代码成绩,也不自动成为生产工程冠军。

证据快照:2026-09-05;旧单项与 Vals 标注 8 月历史

集中查看

这个模型的主要判断

综合能力

AA v4.2 47,邻近 Sol medium 46 / high 48;中文、视觉和阿里生态单独评价,长程代码不按 Sol 高档估计。

实际编程

DeepSWE xhigh 为 57%±3,和 Sonnet 5 max 54%±4、GPT-5.4 xhigh 52%±2 的区间更接近;明显低于 Luna max / GPT-5.5 xhigh 的 67%,不应按 Sol xhigh 估计长程代码

使用限制

正式版已有三类独立信号,但没有证明它在通用能力或成功任务成本上胜过同价位前沿模型。Qwen3.8-Flash-Next 只保留观察;中国端点人民币价与第三方美元报价必须分开看。

当前状态

本页主体为 2026-08-03 正式版。另有 Max 0902 修订及 Flash-Next 观察:0902 有初步 WebDev,Flash-Next 有 AA 与初步 WebDev;缺同版独立长程工程,不继承旧分或自动升级正式结论。

价格口径

中国端点当前为输入 ¥12 / M、输出 ¥36 / M、缓存命中 ¥1.50 / M;本站美元计算器不混用人民币价格