模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Meta上一代代理基线核验 2026-07-17

Meta Muse Spark 1.1

尚未迁移的 Muse 旧流程与 1.2 升级前后对照

已有跨来源证据

AA v4.2 xhigh 43(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

AA v4.243 · xhigh · 估算,等待独立评测 · 核验 2026-09-05

上下文
1M
默认推理
自适应思考
API 输入
$1.25 / M
API 输出
$4.25 / M
开放权重
判断把握
中高

集中查看

这个模型的主要判断

综合能力

AA v4.2 xhigh 43(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

实际编程

工具编排强;纯代码和完整工程证据仍少于当前前沿主力

使用限制

医疗、税务和法律等专业流程表现突出;不能据此推断纯代码或所有多代理任务都领先。

当前状态

已由 Muse Spark 1.2 接替;保留旧流程、旧分数和历史对照

直接核对

本页的关键来源

官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。