综合指数接近 Sol medium,但规划是否稳、会不会漏文件、工具调用多少步,必须看真实工作。旧 v4.1.1 的 57 不与这些分数混排。
Z.AI低价合格执行者核验 2026-08-29
GLM-5.3-Flash
强模型已写清计划后的批量实现、可回滚代码支线、结构化抽取与有引用的低风险知识工作
AA v4.2 46(原页未标 effort),邻近 Sol medium 46。DeepSWE 的 max 63%±4%是另一方法,不能据此承诺模糊需求规划等效。
AA v4.2:46 · 原页未标档位 · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- max
- API 输入
- $0.15 / M
- API 输出
- $0.50 / M
- 开放权重
- MIT
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。高分很亮眼,真实角色仍是低价执行者
GLM-5.3 Flash 高分,但到底强不强
一句话:它足以做有计划、有测试的正式执行工作,但不适合接手模糊需求和关键终审。AA v4.2 接近 Sol medium,不代表真实仓库成功率相同;突出优势仍是可用质量之上的低价。粗略想成 100 道陌生工程,它点估计做成约 63 道,比 67% 组少约 4 道、比 Sol max 少约 10 道。误差有重叠时不能硬排,但它与最强负责人仍有可感知差距。
保留旧方法的输出量与速度记录,不当作 v4.2 重测账单。单个 token 很便宜,但长输出、多次工具调用和返工仍会放大等待与总成本。
本站成本计算器用长期价,避免优惠结束后低估预算。短期试用可以享受五折,但不应据此设计长期产品成本。
最稳的用法是:Sol / Opus / GLM-5.3 先把目标、文件边界和验收测试写清;Flash max 执行可回滚支线;测试失败先判断是漏步骤还是理解错,理解错就把任务交回强模型,而不是反复重跑。
AA 与 DeepSWE 已足够证明它不是纯新闻模型,但社区反馈仍出现忘记要求、计划缺口、输出偏长和速度波动。本站因此正式收录到成本价值轨道,不把它升级成模糊需求负责人或通用前沿前三。
证据快照:2026-09-05 · 含明确标注的历史运行
集中查看
这个模型的主要判断
AA v4.2 46(原页未标 effort),邻近 Sol medium 46。DeepSWE 的 max 63%±4%是另一方法,不能据此承诺模糊需求规划等效。
DeepSWE max 63%±4%、平均 $0.24/题;Sol max 73%±3%。低单价与可验收执行有价值,不能承诺同等成功率。
它更像流程明确后的便宜执行者,不是模糊需求负责人。AA 约 49 token/s 且输出偏长,DeepSWE 平均 123 步;低 token 单价不等于最快完成。
2026-08-26 发布;匿名预览名为 Ox Alpha,支持文字与图片输入、low / high / max,默认 max
本站计算器使用长期 list price;官方 50% 限时价为 $0.075 / $0.25、缓存 $0.015,至 2026-09-09 24:00(UTC+8)
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。