模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Anthropic高端实用与复核核验 2026-07-31

Claude Opus 5

复杂代理编程、开放式架构、长链路企业任务与高质量成品

已有跨来源证据

AA v4.2 max 54;Vals Index v2 67.21%±0.98。仍是高端实用与异家复核候选;与新旗舰的差距因任务而异。

AA v4.254 · max · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
high
API 输入
$5 / M
API 输出
$25 / M
开放权重
判断把握

集中查看

这个模型的主要判断

综合能力

AA v4.2 max 54;Vals Index v2 67.21%±0.98。仍是高端实用与异家复核候选;与新旗舰的差距因任务而异。

实际编程

DeepSWE、Vals 与 CursorBench 支持前沿多文件 / 代理能力;Anthropic 的 Frontier-Bench v0.1 发布快照提供补充信号,但属于厂商内部运行。与 Sol 的长程代码通过率误差重叠,终端、成本和代码审查仍需按任务分开

使用限制

长期 Claude Code 连续观测仍为空;Vals Terminal 与 Anthropic 的 Frontier-Bench 发布测试都包含 Opus 4.8 拒答回退。Opus 5 更主动、自检更多,也可能扩大任务范围。

当前状态

2026-07-24 发布;Claude Max 默认模型,Claude Pro 当前最强可用模型