跳到实验结果
模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

带日期的数据快照 · 不是实时榜单

已保存一份带日期的检查快照

零 Token 数据观察室

如果你发现模型分数、价格或状态好像变了,先来这里看:数据来自什么时候、发生了什么、证据是否足够。一次页面变化或服务波动,不能直接叫作模型“降智”。

先看数据是不是新的已保存一份带日期的检查快照

最近一次检查记录:2026/07/14 02:28;最近可用快照:2026/07/14 02:28。日期较旧时,只把它当作历史记录。

正式推荐仍以经过核对的资料为准

30 秒判断要不要继续看

这页能发现线索,不能替你下结论

先看它能回答什么,再决定是否展开旧快照和技术细节。
可以回答

已登记来源有没有明显变化

例如结构化榜单条目变化、官网页面指纹变化,或官方仓库暂时无法访问。

不能回答

新模型发布与“今天是否降智”

固定采集器不理解新型号、评测方法变化和真实体验,不能把一次波动写成能力回退。

如何判断

固定规则先筛,复杂变化再核对

明显变化会先被标记;是否值得改正式结论,还要继续核对原始来源和评测口径。

你该怎么用

先看日期,再回正式模型页

快照只用于发现值得复核的线索;最终选择仍以最新模型资料、对比页和自己的任务测试为准。

最近一次数据快照

先看数据有多旧,再看发生了什么

这是一份带日期的历史摘要,不承诺实时更新。快照较旧时,请直接打开对应官方来源确认当前状态。
最新状态已保存一份带日期的检查快照

核心数据通过固定规则校验 · 2026/07/14 02:28

最近可用快照2026/07/14 02:28

snapshot-e0406621107abf8e

更新频率按需更新,不承诺固定频率

只有来源和口径都可核对时,才保留新快照

最终怎么选以模型资料页与对比页为准

这里的快照只提供线索,不会直接改变推荐

来源怎么理解

三类监测信息,不能混成一个排名

1 个来源结构化榜单

读取官方提供的明确字段和成绩,可用于发现榜单条目变化。

  • SWE-bench 官方结构化榜单本次已读取
1 个来源官网变更指纹

只判断价格页等官方页面是否发生明显变化,不把网页文字直接当成新结论。

  • DeepSeek 官方价格页本次已读取
1 个来源来源健康检查

确认官方仓库仍可访问、身份没有改变;它不是模型能力分数。

  • LiveBench 官方仓库本次已读取
历史检查

每次检查都留下可回看的摘要

  1. 轻量来源检查校验通过

    来源 3/3 个成功; 变化 3 项; 异常 0

历史数据样例

需要核对方法时再展开

下面使用 2026-07-10 打包快照重复验证规则。它不是实时榜单,也不是当前模型结论;第一次访问无需阅读全部技术细节。
展开旧快照与规则筛选结果适合想进一步核对来源、快照日期和变化记录的人
打包快照日期2026-07-10
这份快照的检查时间2026-07-10 08:00 UTC
固定规则结果1 项保持,4 项需要观察

本次规则运行结果

正式结论和候选结论

正式结论是首页当前采用的版本;候选结论只用于观察,不代表已经通过人工复核。
阅读方式

当前显示 5 个场景;候选变化不会自动生效

通用推理

候选变化:正式为 Fable 5、Sol,候选为 Fable 5

建议人工复核
正式结论(首页正在使用)Fable 5 与 Sol 同处通用推理前沿

来自本轮人工调研和多来源核验,本实验不会修改它。

候选结论(规则试运行)影子候选建议 Fable 5;仅供人工复核,不会修改正式结论。

只用于比较和观察,不代表已经通过人工复核。

为什么得到这个结果
  • 2 个原始指标先在各自相同测试环境内比较,再汇总跨来源支持。
  • Fable 5 的时间与来源质量加权分为 100,获得 2 个独立来源支持。
判断把握
(规则评分 89/100)
独立来源
2
最近测量
2026-07-02 00:00 UTC
比较指标
AA v4.1 分数、Vals Index %

规则评分用于说明来源数量、新鲜度和可比性,不是正确率,也不是结论成立的概率。

仓库修复

证据不足:未生成可替换 Sol 的候选结论

证据不足
正式结论(首页正在使用)仓库修复优先 Sol

来自本轮人工调研和多来源核验,本实验不会修改它。

候选结论(规则试运行)可用独立证据不足,本轮不生成候选更新;正式结论仍为“仓库修复优先 Sol”。

只用于比较和观察,不代表已经通过人工复核。

为什么得到这个结果
  • 1 个原始指标先在各自相同测试环境内比较,再汇总跨来源支持。
  • Fable 5 独立来源不足(1/2);Sol 独立来源不足(1/2),不能推动更新。
判断把握
(规则评分 0/100)
独立来源
0
最近测量
暂无可用时间
比较指标
SWE-bench Verified 通过率 %

规则评分用于说明来源数量、新鲜度和可比性,不是正确率,也不是结论成立的概率。

完整应用

保持:候选与正式结论一致(Fable 5)

保持
正式结论(首页正在使用)完整应用优先 Fable 5

来自本轮人工调研和多来源核验,本实验不会修改它。

候选结论(规则试运行)候选结论与正式基线一致:推荐 Fable 5。

只用于比较和观察,不代表已经通过人工复核。

为什么得到这个结果
  • 2 个原始指标先在各自相同测试环境内比较,再汇总跨来源支持。
  • Fable 5 的时间与来源质量加权分为 100,获得 2 个独立来源支持。
判断把握
(规则评分 88/100)
独立来源
2
最近测量
2026-07-04 00:00 UTC
比较指标
CursorBench 3.2 得分 %、Vibe Code Bench 得分 %

规则评分用于说明来源数量、新鲜度和可比性,不是正确率,也不是结论成立的概率。

终端代理

证据不足:未生成可替换 Sol 的候选结论

证据不足
正式结论(首页正在使用)终端长任务优先 Sol

来自本轮人工调研和多来源核验,本实验不会修改它。

候选结论(规则试运行)可用独立证据不足,本轮不生成候选更新;正式结论仍为“终端长任务优先 Sol”。

只用于比较和观察,不代表已经通过人工复核。

为什么得到这个结果
  • 1 个原始指标先在各自相同测试环境内比较,再汇总跨来源支持。
  • Fable 5 独立来源不足(1/2);Sol 独立来源不足(1/2),不能推动更新。
判断把握
(规则评分 0/100)
独立来源
0
最近测量
暂无可用时间
比较指标
Terminal-Bench 2.1 通过率 %

规则评分用于说明来源数量、新鲜度和可比性,不是正确率,也不是结论成立的概率。

成本敏感

阻断:存在异常或不完整观测,正式结论 DeepSeek V4 Pro 不变

已阻断
正式结论(首页正在使用)批量成本敏感任务优先 DeepSeek V4 Pro

来自本轮人工调研和多来源核验,本实验不会修改它。

候选结论(规则试运行)存在异常或不完整观测,本轮保留正式结论“批量成本敏感任务优先 DeepSeek V4 Pro”,等待人工复核。

只用于比较和观察,不代表已经通过人工复核。

为什么得到这个结果
  • 1 个原始指标先在各自相同测试环境内比较,再汇总跨来源支持。
  • DeepSeek V4 Pro 独立来源不足(1/2);Qwen 3.7 Plus 独立来源不足(1/2),不能推动更新。
  • Grok 4.5 的异常跃迁已进入阻断区。
判断把握
(规则评分 0/100)
独立来源
0
最近测量
暂无可用时间
比较指标
估算任务成本 USD

规则评分用于说明来源数量、新鲜度和可比性,不是正确率,也不是结论成立的概率。

安全护栏

被阻断的变化

单一来源、数据过期、字段不完整、测试环境不可比或异常跳变,都不能静默改变候选结论。
已阻断 · 仓库修复

Fable 5

同一指标与测试环境内缺少可比较模型

已阻断 · 仓库修复

Sol

同一指标与测试环境内缺少可比较模型

已阻断 · 终端代理

Fable 5

同一指标与测试环境内缺少可比较模型

已阻断 · 终端代理

Sol

同一指标与测试环境内缺少可比较模型

已阻断 · 成本敏感

Grok 4.5

输入已标记为异常,等待人工核验

怎样避免误判

四步判断一条变化值不值得相信

先核对来源和日期,再核对比较口径;证据不足时保留疑问,不急着改模型选择。
第一步确认是不是原始来源

优先看官方页面、项目仓库或有明确方法说明的独立评测。

第二步确认数据是不是够新

模型、推理档和测试方法都可能变化;旧快照不能冒充今天的结果。

第三步确认比较口径是否一致

服务状态、榜单分数、价格变化和社区体验不能直接相加。

第四步确认有没有第二类证据

重要能力结论需要不同方法互相支持,单一来源只适合提出问题。

结论边界线索不会自动变成推荐

只有数据可比、来源稳定并经过复核,才可能进入正式模型资料。

不要这样读一次异常不等于模型变笨

先排除服务故障、样本不足和评测变化,再讨论能力回退。

当前建议

把它当线索库,不把它当实时榜单

它适合帮你发现“哪里值得继续查”,不适合直接回答“今天谁是第一”。回到模型选择器