服务可用性
官方状态页记录的错误、延迟、限流和局部故障。它只能说明服务情况,不能说明模型能力变弱。
模型状态观测 · 带日期的历史快照
服务状态、同任务能力测试和社区体验必须分开看;本页不是实时监控,任何一条也不能单独证明模型“降智”。
三条信号不能混算
官方状态页记录的错误、延迟、限流和局部故障。它只能说明服务情况,不能说明模型能力变弱。
同一任务集、模型版本、推理档、工具与评分方法的重复测试,并需要样本量和显著性判断。
社区关于速度、风格、拒答或额度的反馈。只能帮助发现问题,不能单独宣布“降智”。
第三方编程能力观测
Fable、Opus 5、Opus 4.8、Sonnet 和 Mythos 的版本、推理档与可用范围不同。每个标签只显示自己的证据。
日、周、月三个窗口都没有越过来源设定的显著性阈值。
最新日测是 78%,较 73% 基线高 5.0 个百分点; 日测样本只有 50 题,要超过 ±13.0 个百分点才达到来源的显著性门槛。
如果只是今天突然难用,先检查 Claude 官方服务状态用于判断变化是否超出正常波动
较基线 +5.0 个百分点 · 未达显著性
较基线 +0.8 个百分点 · 未达显著性
较基线 -1.1 个百分点 · 未达显著性
怎样读:优先看 7 天和 30 天窗口;单日只有 50 题,波动会更大。只有来源标为统计显著,才值得进入“疑似回归”的下一轮复核。
边界:这是 Claude Code CLI 与 Opus 4.8 的组合观测,模型与工具任一更新都可能改变结果;它不代表 Claude 网页版、API 或通用智力。
同页另有 Margin Lab 的日、周、月连续观测;这里仅保留跨模型同任务历史快照。
通过 4 / 7 个有效任务 · 3 个基础设施无效样本
通过 5 / 10 个有效任务
通过 4 / 9 个有效任务 · 1 个基础设施无效样本
怎样读:固定 10 题,每通过 1 题计 15 分,满分 150。不同推理档的日期和观测轮次并不完全相同,不能只看最高分宣布唯一冠军。
当前边界:Claude Code 在固定 10 题任务集上的分模型、分推理档历史快照,不代表网页端、API 或通用智力。来源暂停期间只保留最后可靠快照,不宣称实时。
近 18.2 小时观测 -6.9 分 · 样本 +3
近 18.2 小时观测 -4.6 分 · 样本 +2
近 18.2 小时观测 +4.6 分 · 样本 +6
近 18.2 小时观测 +5.9 分 · 样本 +3
近 18.2 小时观测 +6.3 分 · 样本 +5
近 18.2 小时观测 +2.3 分 · 样本 +21
近 18.2 小时观测 -1.2 分 · 样本 +18
近 18.2 小时观测 -11.0 分 · 样本 +13
近 18.2 小时观测 +1.5 分 · 样本 +20
近 18.2 小时观测 -4.9 分 · 样本 +1
怎样读:分数用于观察同一任务体系下的模型与推理档;费用和耗时均为来源站单题平均值。约 1 分差异、任务数变化或单日波动都不应解读为确定回退。
来源容错:正常只读取 Codex 雷达公开摘要;主来源失败时才切换到分布式雷达上游,不在同一次正常采集中重复请求。
已通过准入 · 官方状态
All Systems Operational
All Systems Operational
本次说明:官方状态接口本次读取或字段校验失败
Microsoft Office add-in availability · identified · 2026/07/23 05:12
Partial System Outage
第二方法 · 外部参考
Codex CLI + 模型组合的每日 SWE-Bench Pro 信号
未来宣布“疑似回归”之前