模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Anthropic高难任务旗舰核验 2026-09-05

Claude Fable 5.1

高难规划、含糊多文件实现、长程专业工作与异家复核

已有跨来源证据

AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。

AA v4.257 · max · 含安全回退 · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
high
API 输入
$10 / M
API 输出
$50 / M
开放权重
判断把握
中高

新版能力、档位成本与会员额度分别看

Fable 5.1 的 low、high 与 max 差在哪里

综合题与 Cursor 多文件任务都显示前沿潜力,但“相当于 Sol 哪档”取决于方法:AA 低档目前含估算,Cursor 中 low—medium 已跨过 Sol max 的点估计。最高 max 适合质量收益足够大的任务,不是默认最划算档。
AA v4.2 · 含安全回退low 48 / medium 50 / high 52 / xhigh 54(均估算);max 57
熟悉的参照Sol high 48 · xhigh 50 · max 51

low—xhigh 为估算参考,等待完整独立评测;不能与 max 实测同等对待。按当前点位,low 接近 Sol high,medium 接近 Sol xhigh,high 位于 Sol max 邻近区间。

CursorBench 3.2 · 五档多文件任务low 66.2% · medium 68.0% · high 69.4% · xhigh 72.8% · max 73.4%
熟悉的参照Sol max 67.2%;Fable xhigh $6.96 / max $9.64 每题

在 Cursor 这套任务里,low 与 medium 跨过 Sol max 的点位。max 比 xhigh 仅多 0.6 个百分点、平均费用多约 39%;没有置信区间或本站复测,不能说这点提升对人人都值得。

CodeRabbit · 45 项代码审查Low 召回 61.0% · High 57.1%
熟悉的参照两种配置均完成 45 任务;不直接映射 API low / high

这项审查没有显示提高配置就提高召回;与别的模型还存在评论过滤和测试时间差异,不能硬拼总榜。审查仍需测试和异家复核。

官方 API 与会员 · 两种费用输入 $10 / 输出 $50;缓存读取 $0.25
熟悉的参照Opus 5 缓存读取 $0.50;Pro 用额外点数,Max 有共享周上限

普通输入和输出单价未降;节省主要来自缓存。高缓存代理可能更省,但长输出和 max 可能抵消折扣;会员五小时及周额度不能按 API 折扣同比换算。

直接体验 · 正反案例,不是胜率同一 SVG:high 29.6 秒 / $0.13;max 13 分 54 秒 / $3.30
熟悉的参照Simon 偏好 max 成品;七章改写案例却仍需逐行编辑

前者每档仅一次,不能当通用基准。AI-Native PM 的 Ultracode 改写更少催促,但顶档五小时额度 43 分钟耗尽;模型、并行框架和订阅计量的影响无法完全拆开。

怎么实际使用

API / Claude Code 从 high 起,日常试 medium;长交付只有测出明显质量收益再升 xhigh / max。官方提醒最高档可能在思考中先起草整份交付再输出,需给足总 token 预算,并尽量定点编辑文件。

不要怎样误读

Fable 5 旧成绩不会继承给 5.1;当前独立 DeepSWE 尚缺 5.1。AA 与 Vals 有安全回退,Mythos 5.1 又是审核限定入口;不能把这些对象混成普通用户可得的纯模型成绩。

证据快照:2026-09-05 · AA v4.2 / CursorBench 3.2

集中查看

这个模型的主要判断

综合能力

AA v4.2 max 57(含安全回退)、Astra max 55、Sol max 51。综合领先不保证每个任务领先;Fable 低至 xhigh 为估算,不当作实测等效。

实际编程

CursorBench 3.2:max 73.4%、xhigh 72.8%;最高档仅多 0.6 个百分点却贵约 39%,日常先 high,难题再 xhigh/max。

使用限制

AA 与 Vals 使用默认安全回退,不能视为纯 Fable 无回退成绩;新版本长程实战与独立 DeepSWE 仍待补。

当前状态

已有跨来源证据,最近核验 2026-09-05

价格口径

标准 API 每百万 Token;缓存读取 $0.25,5 分钟缓存写入 $12.50,1 小时写入 $20。会员额度另计。