AA v4.2 max 54;Vals Index v2 67.21%±0.98。仍是高端实用与异家复核候选;与新旗舰的差距因任务而异。
Anthropic高端实用与复核核验 2026-07-31
Claude Opus 5
复杂代理编程、开放式架构、长链路企业任务与高质量成品
已有跨来源证据
AA v4.2 max 54;Vals Index v2 67.21%±0.98。仍是高端实用与异家复核候选;与新旗舰的差距因任务而异。
AA v4.2:54 · max · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- high
- API 输入
- $5 / M
- API 输出
- $25 / M
- 开放权重
- 否
- 判断把握
- 高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。成熟 Claude 对照修真实仓库 Bug
DeepSWE max 74%±4,仍在领先区间;是否比新版省钱要看缓存、输出与重试。
较强:同口径仓库任务 · 判断把握 高组合流程大型重构与技术迁移已有可靠 Claude 工具链时保留旧基线,独立检查迁移边界
中等:编程分榜与工程方法交叉 · 判断把握 中高常规方案对照需求梳理与产品方案成熟 Claude 工作流仍可使用;普通输入与输出比 Fable 5.1 更低价,不因新版发布立即替换。
编辑判断:由工程与应用证据推导 · 判断把握 中质量成本对照英文写作、方案与专业表达普通输入与输出单价较低;Fable 5.1 缓存读取反而更便宜,按实际任务账单决定。
编辑判断 + 人类偏好信号 · 判断把握 中高集中查看
这个模型的主要判断
DeepSWE、Vals 与 CursorBench 支持前沿多文件 / 代理能力;Anthropic 的 Frontier-Bench v0.1 发布快照提供补充信号,但属于厂商内部运行。与 Sol 的长程代码通过率误差重叠,终端、成本和代码审查仍需按任务分开
长期 Claude Code 连续观测仍为空;Vals Terminal 与 Anthropic 的 Frontier-Bench 发布测试都包含 Opus 4.8 拒答回退。Opus 5 更主动、自检更多,也可能扩大任务范围。
2026-07-24 发布;Claude Max 默认模型,Claude Pro 当前最强可用模型