模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Anthropic成熟高端基线核验 2026-07-23

Claude Opus 4.8

开放式架构、可靠长任务、范围控制、代码复核与企业工作

已有跨来源证据

AA v4.2 max 46(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

AA v4.246 · max · 估算,等待独立评测 · 核验 2026-09-05

上下文
1M
默认推理
high
API 输入
$5 / M
API 输出
$25 / M
开放权重
判断把握

集中查看

这个模型的主要判断

综合能力

AA v4.2 max 46(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

实际编程

完整应用表现强;终端代理通常弱于 Sol

使用限制

Opus 5 已成为同价位新一代默认候选;4.8 更适合保留成熟旧流程和连续观测基线,不应把旧成绩直接继承给新版。

当前状态

已有跨来源证据,最近核验 2026-07-23