模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

模型状态观测 · 带日期的历史快照

先判断是服务故障,还是能力真的回退

服务状态、同任务能力测试和社区体验必须分开看;本页不是实时监控,任何一条也不能单独证明模型“降智”。

三条信号不能混算

“今天不好用”至少有三种原因

01

服务可用性

官方状态页记录的错误、延迟、限流和局部故障。它只能说明服务情况,不能说明模型能力变弱。

02

能力回归

同一任务集、模型版本、推理档、工具与评分方法的重复测试,并需要样本量和显著性判断。

03

体验信号

社区关于速度、风格、拒答或额度的反馈。只能帮助发现问题,不能单独宣布“降智”。

第三方编程能力观测

Claude Code 与 Codex,分开看才有意义

两边的模型、工具、任务集和分数口径不同。先选你正在使用的工具,再看它自己的历史;本站不会把两套数字拼成总榜。
先选具体模型不要把 Claude 家族合成一条曲线

Fable、Opus 5、Opus 4.8、Sonnet 和 Mythos 的版本、推理档与可用范围不同。每个标签只显示自己的证据。

来源当前结论

未发现统计显著下降

日、周、月三个窗口都没有越过来源设定的显著性阈值。

最新日测是 78%,较 73% 基线高 5.0 个百分点; 日测样本只有 50 题,要超过 ±13.0 个百分点才达到来源的显著性门槛。

如果只是今天突然难用,先检查 Claude 官方服务状态
历史基线73%

用于判断变化是否超出正常波动

最新日测78%50 个测试样本

较基线 +5.0 个百分点 · 未达显著性

近 7 天74%300 个测试样本

较基线 +0.8 个百分点 · 未达显著性

近 30 天72%1,450 个测试样本

较基线 -1.1 个百分点 · 未达显著性

测试对象
Claude Code CLI + Opus 4.8
任务集
SWE-Bench Pro 精选任务集
统计口径
95% 置信区间 · p < 0.05

怎样读:优先看 7 天和 30 天窗口;单日只有 50 题,波动会更大。只有来源标为统计显著,才值得进入“疑似回归”的下一轮复核。

边界:这是 Claude Code CLI 与 Opus 4.8 的组合观测,模型与工具任一更新都可能改变结果;它不代表 Claude 网页版、API 或通用智力。

补充证据 · 同任务多档

Opus 4.8 的推理档分别看

同页另有 Margin Lab 的日、周、月连续观测;这里仅保留跨模型同任务历史快照。

xhigh2026/07/11 01:22
60/ 150 任务分

通过 4 / 7 个有效任务 · 3 个基础设施无效样本

本轮任务费用
$43.59
串行总耗时
5.9 小时
有效观测轮次
3
high2026/07/12 16:33
75/ 150 任务分

通过 5 / 10 个有效任务

本轮任务费用
$32.36
串行总耗时
2.4 小时
有效观测轮次
8
medium2026/07/09 10:28
60/ 150 任务分

通过 4 / 9 个有效任务 · 1 个基础设施无效样本

本轮任务费用
$24.82
串行总耗时
1.7 小时
有效观测轮次
2

怎样读:固定 10 题,每通过 1 题计 15 分,满分 150。不同推理档的日期和观测轮次并不完全相同,不能只看最高分宣布唯一冠军。

当前边界:Claude Code 在固定 10 题任务集上的分模型、分推理档历史快照,不代表网页端、API 或通用智力。来源暂停期间只保留最后可靠快照,不宣称实时。

已通过准入 · 官方状态

OpenAI、Claude 与 Kimi 分别保留自己的口径

一个来源失败时,其他来源继续读取;失败项沿用上次可靠结果并明确标记,不用空数据覆盖。
OpenAI官方报告整体正常

OpenAI 官方状态

All Systems Operational

来源更新时间
2026/07/10 03:25
未关闭事件
0
采集状态
本次已读取
打开官方状态页
Anthropic整体正常,仍有局部事件

Claude 官方状态

All Systems Operational

来源更新时间
2026/07/23 17:23
未关闭事件
1
采集状态
沿用上次可靠结果

本次说明:官方状态接口本次读取或字段校验失败

查看局部事件

Microsoft Office add-in availability · identified · 2026/07/23 05:12

打开官方状态页
Moonshot AI官方报告存在服务异常

Kimi 官方状态

Partial System Outage

来源更新时间
2026/07/31 17:25
未关闭事件
0
采集状态
本次已读取
打开官方状态页

第二方法 · 外部参考

换一种任务集,再交叉检查

不同来源的任务集、工具和评分口径不同。下列结果不会与上面的两条观测混算,查看时以原站最新数据为准。
外部实时参考

Margin Lab Codex Tracker

Codex CLI + 模型组合的每日 SWE-Bench Pro 信号

查看来源站实时数据

未来宣布“疑似回归”之前

至少同时满足四个条件

  1. 同一任务、模型版本、推理档、provider 与工具环境可比
  2. 样本量与误差足以区分正常波动,不用单日点估计吓人
  3. 至少一个第二方法或连续多日结果支持同一方向
  4. 服务事故、限流与评测环境变化已经被单独排除