模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Meta新品观察核验 2026-09-05

Meta Muse Spark 1.3

专业工作与长代理新品观察;先核对可用版本和账户入口

阶段性判断

AA v4.2 xhigh 52;限预览 max 53 另算。当前只作专业与长代理观察,不把限预览成绩当作普通账户可用上限。

AA v4.252 · xhigh · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
xhigh
API 输入
$1.25 / M
API 输出
$4.25 / M
开放权重
判断把握

已有独立信号,不继承上一代专业任务成绩

Muse Spark 1.3 为什么仍先列观察

公共 xhigh 已有 AA 综合分与 Arena WebDev 前端偏好信号,值得在自己的任务里试测;max 的公开可用性和价格仍有未解口径。前端偏好不等于长程工程通过率,也不能把 Muse 1.2 的法律、金融成绩移到新版。
AA v4.2 · 公共 xhighxhigh 52
熟悉的参照Astra medium 52 · Sol max 51

只说明综合题的点位接近;1 点不等于质量稳定领先。旧发布文章的 61 来自 v4.1.1,不与当前指数混列。

AA · max 可用性边界max 最高展示 53 · limited preview
熟悉的参照公共 xhigh 的价格不能复制给 max

AA 发布说明称 max 是受限预览且没有公开价格,Meta 发布文字较宽泛。购买或接入需核对实际账户权限,不写成所有用户已能使用最高档。

Arena WebDev · 2026-09-04 初榜xhigh 1618±19 · 1,128 票
熟悉的参照Sol xhigh 1618±7

前端成品偏好与 Sol xhigh 同点,区间重叠且样本仍少;这是第二种独立信号,不是无证据,但它不衡量陌生仓库长程任务或生产回归测试通过率。

Meta 自测 · 长程代码DeepSWE 75.4% 属厂商运行
熟悉的参照Datacurve 当前原榜仅有 Muse 1.2;未检到 Cursor 同版记录

使用同名题集不等于独立运行。KernelBench 的少量单会话案例也不能补足广泛仓库证据,所以不靠这项自报提升为正式代码首选。

AA 公共 xhigh · 价格与规格输入 $1.25 / 输出 $4.25 / 缓存 $0.15 · 1M
熟悉的参照Muse Code / Meta Model API;开放权重仍为计划

这些是公共 xhigh 的已报告价格与入口,不是 max 的承诺。低单价需要同题质量底线、重试和人工返工的检验,才能称为真正更省。

怎么实际使用

先用公开 xhigh 跑少量可回滚、可验收的任务;已有 Muse 1.2 专业流程先保留,完成同题复测后再迁移。若账户提供 max,先确认费率与权限,不把预览成绩当包月权益。

不要怎样误读

当前是观察/价值候选,已有 AA 与 Arena WebDev 两种不同信号;仍不能用前端偏好和厂商 DeepSWE 合成独立长程工程冠军。新版发布与旧版继续可用是两件事,资料与结果按精确版本保留。

证据快照:2026-09-05 · 公共 xhigh 与受限 max 分开

集中查看

这个模型的主要判断

综合能力

AA v4.2 xhigh 52;限预览 max 53 另算。当前只作专业与长代理观察,不把限预览成绩当作普通账户可用上限。

实际编程

厂商公布的 DeepSWE 结果是 Meta 自跑,当前独立 DeepSWE 尚未收录精确 1.3;不继承 1.2 成绩。

使用限制

公共 xhigh 已有 AA 与 Arena 前端偏好两类信号,但独立长程工程仍不足,继续观察;不将限预览 max 当普通账户可用能力。

当前状态

阶段性判断,最近核验 2026-09-05

价格口径

公开 xhigh 报价为输入 $1.25、输出 $4.25、缓存命中 $0.15 / M;限预览 max 的准入和计价不继承这一行。