综合题位于 Sol high—xhigh 的邻近区间。旧 v4.1.1 的 60 属于另一版方法,不是今天分数下降;这里的指数差也不是智商或工程完成率百分比。
Z.AI开放权重前沿旗舰核验 2026-08-29
GLM-5.3
复杂代码、长程 Agent、中文专业任务,以及有大型推理基础设施的开放权重部署
AA v4.2 max 49、K3 max 50;仍属开放权重高端,不能把英文综合与代码结果外推成所有中文任务同档。
AA v4.2:49 · max · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- max
- API 输入
- $1.40 / M
- API 输出
- $4.4 / M
- 开放权重
- GLM-5.3 License(开放权重,商业条件需核对)
- 判断把握
- 高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。AA v4.2 max 49、DeepSWE 69%±3,支持复杂规划与开放权重主控试用。
中高:跨领域代理任务 + 工具行为信号 · 判断把握 中高开放综合前沿开放权重与私有部署AA v4.2 max 49、DeepSWE 69%±3,完整权重已发布;但约 756 GB 权重仍需要大型推理基础设施。
较强:开放状态、价格与独立结果 · 判断把握 中高开放前沿与国内 API中国大陆访问、支付与中文生态综合与长程工程已进入前沿带,官方 API 与完整权重都已提供。
产品与地区优先:能力榜只是其中一层 · 判断把握 中高受控部署候选合法但容易误拒的专业任务开放权重允许组织在自身规则和审计环境中运行;许可证与高风险能力仍需单独审计。
不设冠军:缺少可复现专项评测 · 判断把握 低开放权重前沿,不等于普通电脑轻松部署
GLM-5.3 到底属于什么水平
一句话:GLM-5.3 是开放权重强档。AA v4.2 接近 K3 与 Sol 高档,原创长程工程也与 K3 同点;但与新 Fable 5.1 / Astra 的差距要分任务看,不能把旧版综合分当成当前排名。粗略想成 100 道同类陌生工程,它点估计做成约 69 道,比 Sol 少约 4 道、比 Opus 少约 5 道;但误差区间互相重叠,所以更诚实的结论是同一强档,而不是固定名次。
它的 token 单价明显低于 Sol 和 Opus,也略低于 Grok;但长任务会产生多少输出、重试几次、等多久,仍决定一件事最终花多少钱。
能下载不等于普通电脑能顺畅运行。大多数个人和小团队更适合先用官方 API 或成熟托管服务,再决定是否值得自建推理集群。
需要开放权重、中文专业任务、复杂代码或长程 Agent 时,可把 GLM-5.3 max 作为 K3 / Sol / Opus 的正式候选做自己的 A/B;高风险安全、法律或发布决定仍保留另一家前沿模型与机器测试复核。
正式定位来自 AA 综合评测与 DeepSWE 原创长程工程两种不同方法;厂商网络安全与自报榜单只作补充。页面不把同分写成同能力,也不把开放权重写成零成本部署。
证据快照:2026-09-05 · AA v4.2 / DeepSWE v1.1
集中查看
这个模型的主要判断
AA v4.2 max 49、K3 max 50;仍属开放权重高端,不能把英文综合与代码结果外推成所有中文任务同档。
DeepSWE max 为 69%±3:按 100 道同类原创长任务粗略看,点估计比 Sol max 少约 4 道,与 K3 同点;误差区间重叠时按同档
AA 与 DeepSWE 已形成两种独立信号,但网络安全优势主要来自厂商自报;753B 总参数、40B 激活参数与约 756 GB 权重仍不是普通电脑部署规模。
2026-08-18 发布,完整权重、API 与 low / high / max 推理档均已提供;默认 max
Z.AI 官方国际 API 挂牌价;缓存存储目前限时免费
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。