模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Z.AI低价合格执行者核验 2026-08-29

GLM-5.3-Flash

强模型已写清计划后的批量实现、可回滚代码支线、结构化抽取与有引用的低风险知识工作

已有跨来源证据

AA v4.2 46(原页未标 effort),邻近 Sol medium 46。DeepSWE 的 max 63%±4%是另一方法,不能据此承诺模糊需求规划等效。

AA v4.246 · 原页未标档位 · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
max
API 输入
$0.15 / M
API 输出
$0.50 / M
开放权重
MIT
判断把握
中高

高分很亮眼,真实角色仍是低价执行者

GLM-5.3 Flash 高分,但到底强不强

一句话:它足以做有计划、有测试的正式执行工作,但不适合接手模糊需求和关键终审。AA v4.2 接近 Sol medium,不代表真实仓库成功率相同;突出优势仍是可用质量之上的低价。
AA v4.2 · 综合推理Flash 46
熟悉的参照Sol medium 46 / high 48 · Terra 47 · GLM-5.3 49

综合指数接近 Sol medium,但规划是否稳、会不会漏文件、工具调用多少步,必须看真实工作。旧 v4.1.1 的 57 不与这些分数混排。

DeepSWE · 原创长程工程max 63%±4 · 约 $0.24 / 题
熟悉的参照DeepSeek Pro max 63%±6 · Luna max / GPT-5.5 xhigh / Grok 4.6 medium 67% · Sol max 73%

粗略想成 100 道陌生工程,它点估计做成约 63 道,比 67% 组少约 4 道、比 Sol max 少约 10 道。误差有重叠时不能硬排,但它与最强负责人仍有可感知差距。

2026-08-29 历史运行 · AA v4.1.1约 49 token/s · 输出约 150M token
熟悉的参照DeepSWE 平均约 123 步,GLM-5.3 约 124 步

保留旧方法的输出量与速度记录,不当作 v4.2 重测账单。单个 token 很便宜,但长输出、多次工具调用和返工仍会放大等待与总成本。

Z.AI API · 长期价与限时价长期 $0.15 / $0.50;限时 $0.075 / $0.25
熟悉的参照限时五折至 2026-09-09 24:00(UTC+8)

本站成本计算器用长期价,避免优惠结束后低估预算。短期试用可以享受五折,但不应据此设计长期产品成本。

怎么实际使用

最稳的用法是:Sol / Opus / GLM-5.3 先把目标、文件边界和验收测试写清;Flash max 执行可回滚支线;测试失败先判断是漏步骤还是理解错,理解错就把任务交回强模型,而不是反复重跑。

不要怎样误读

AA 与 DeepSWE 已足够证明它不是纯新闻模型,但社区反馈仍出现忘记要求、计划缺口、输出偏长和速度波动。本站因此正式收录到成本价值轨道,不把它升级成模糊需求负责人或通用前沿前三。

证据快照:2026-09-05 · 含明确标注的历史运行

集中查看

这个模型的主要判断

综合能力

AA v4.2 46(原页未标 effort),邻近 Sol medium 46。DeepSWE 的 max 63%±4%是另一方法,不能据此承诺模糊需求规划等效。

实际编程

DeepSWE max 63%±4%、平均 $0.24/题;Sol max 73%±3%。低单价与可验收执行有价值,不能承诺同等成功率。

使用限制

它更像流程明确后的便宜执行者,不是模糊需求负责人。AA 约 49 token/s 且输出偏长,DeepSWE 平均 123 步;低 token 单价不等于最快完成。

当前状态

2026-08-26 发布;匿名预览名为 Ox Alpha,支持文字与图片输入、low / high / max,默认 max

价格口径

本站计算器使用长期 list price;官方 50% 限时价为 $0.075 / $0.25、缓存 $0.015,至 2026-09-09 24:00(UTC+8)