只说明综合题的点位接近;1 点不等于质量稳定领先。旧发布文章的 61 来自 v4.1.1,不与当前指数混列。
Meta新品观察核验 2026-09-05
Meta Muse Spark 1.3
专业工作与长代理新品观察;先核对可用版本和账户入口
AA v4.2 xhigh 52;限预览 max 53 另算。当前只作专业与长代理观察,不把限预览成绩当作普通账户可用上限。
AA v4.2:52 · xhigh · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- xhigh
- API 输入
- $1.25 / M
- API 输出
- $4.25 / M
- 开放权重
- 否
- 判断把握
- 低
已有独立信号,不继承上一代专业任务成绩
Muse Spark 1.3 为什么仍先列观察
公共 xhigh 已有 AA 综合分与 Arena WebDev 前端偏好信号,值得在自己的任务里试测;max 的公开可用性和价格仍有未解口径。前端偏好不等于长程工程通过率,也不能把 Muse 1.2 的法律、金融成绩移到新版。AA 发布说明称 max 是受限预览且没有公开价格,Meta 发布文字较宽泛。购买或接入需核对实际账户权限,不写成所有用户已能使用最高档。
前端成品偏好与 Sol xhigh 同点,区间重叠且样本仍少;这是第二种独立信号,不是无证据,但它不衡量陌生仓库长程任务或生产回归测试通过率。
使用同名题集不等于独立运行。KernelBench 的少量单会话案例也不能补足广泛仓库证据,所以不靠这项自报提升为正式代码首选。
这些是公共 xhigh 的已报告价格与入口,不是 max 的承诺。低单价需要同题质量底线、重试和人工返工的检验,才能称为真正更省。
先用公开 xhigh 跑少量可回滚、可验收的任务;已有 Muse 1.2 专业流程先保留,完成同题复测后再迁移。若账户提供 max,先确认费率与权限,不把预览成绩当包月权益。
当前是观察/价值候选,已有 AA 与 Arena WebDev 两种不同信号;仍不能用前端偏好和厂商 DeepSWE 合成独立长程工程冠军。新版发布与旧版继续可用是两件事,资料与结果按精确版本保留。
证据快照:2026-09-05 · 公共 xhigh 与受限 max 分开
集中查看
这个模型的主要判断
AA v4.2 xhigh 52;限预览 max 53 另算。当前只作专业与长代理观察,不把限预览成绩当作普通账户可用上限。
厂商公布的 DeepSWE 结果是 Meta 自跑,当前独立 DeepSWE 尚未收录精确 1.3;不继承 1.2 成绩。
公共 xhigh 已有 AA 与 Arena 前端偏好两类信号,但独立长程工程仍不足,继续观察;不将限预览 max 当普通账户可用能力。
阶段性判断,最近核验 2026-09-05
公开 xhigh 报价为输入 $1.25、输出 $4.25、缓存命中 $0.15 / M;限预览 max 的准入和计价不继承这一行。
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。