模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

模型 × 推理档 × 工作流

先选对工作方法,再决定模型要开多强

先说结论:质量优先的新任务把 Astra 与 Fable 5.1 放入主力候选;成熟日常工作仍可用 Sol。先由强模型把需求和验收写清,再让 Gemini 3.8、Terra 或 Luna 执行适合的支线。Max 处理高价值难题,Ultra 只处理真正能并行的任务。

当前前沿对照采用 9 月 5 日核验的 AA v4.2;下方旧模型交互表保留 v4.1.1 历史分与 7 月 23 日 Radar,不能横跨方法比较,也不能当作今天的账单。

当前前沿 · 2026-09-05 核验

Fable 5.1 与 Astra:比 Sol 强在哪里,要多花多少钱?

综合能力优先,Fable 5.1 与 Astra 都值得进入主力候选;不是任何任务都要换掉 Sol。Fable 的综合点估计领先,Astra 在终端与长文档任务中更突出;成熟日常工作仍应比较实际账单、等待和返工。

最高单模型档

Fable 5.1 max

AA 57 · 含回退

当前综合指数领先;AA 加权任务费 $6.12,约为 Astra max 的 2.38 倍。价格更高不代表每个项目收益更大。

看 Fable 的证据与限制 →
更均衡的前沿候选

Astra max

AA 55 · $2.57 / 加权任务

综合点估计低 2 分,但终端与 PDF 阅读单项领先。2 分不是“智力低 2%”;不能用总分代替任务选择。

看 Astra 的能力与成本 →
保留成熟低成本路线

Sol 与 Gemini 3.8

省钱也要有任务证据

Sol 的成熟工作流无需一键推倒。Gemini 3.8 在两种独立代码评测中表现强,可试作有验收的执行者,不等于通用能力第一。

看 Gemini 3.8 的适用任务 →
先排除一个误会:9 月 4 日 AA 改用 v4.2,题目和评分方式都变了。这里的 Sol max 51 与旧表 61 不能相减,更不代表降智。以下均保留具体模型、档位和评测方法。

相当于熟悉的 Sol 哪一档?先分两种工作

综合推理看 AA:Astra low 约在 Sol high 与 xhigh 之间,medium 已到 Sol max 附近。实际 Cursor 编程看另一张表:Fable 5.1 low—medium 已接近 Sol max。两者并不矛盾,因为不是同一套任务,也不是同一种代理工具。

能力接近时的费用对照

能力接近时,怎么选、花多少?

先说结论:按 AA v4.2 的综合题结果,Astra low 与 Sol high 几乎同费;Astra medium 比 Sol max 低约 7.2%。这给出拿相同任务试用两者(A/B 对照)的起点,不是保证每种工作都一样好。

这里的美元是 AA 平均加权测评任务费,不是一次项目报价、成功任务成本或会员扣量。原始数据:Astra AA 页面 ↗ · Sol AA 页面 ↗

低档对日常高档

Astra lowSol high

Astra low · AA49 分 / $0.63
Sol high · AA48 分 / $0.61

Sol high 的价格作比较,Astra low 比它 3.3%。

若与 Sol xhigh50 分 / $0.89)比较,Astra low 便宜 29.2%。

这组数字怎么读

如果只按 AA v4.2 的综合题与加权任务费,先拿相同任务试用两者(A/B 对照);Astra low 与 Sol high 是几乎同费的相邻数字,相比 Sol xhigh,Astra low 也更省。但这不是保证每种工作都一样好。

中档对旗舰高档

Astra mediumSol max

Astra medium · AA52 分 / $1.16
Sol max · AA51 分 / $1.25

Sol max 的价格作比较,Astra medium 比它 7.2%。

这组数字怎么读

Astra medium 在 AA 综合题比 Sol max 高 1 分、加权任务费低一些,适合在有明确验收的相同任务上试用;若任务质量、账单或耗时不合适,保留成熟流程,不因这 1 分就切换。

只据 AA 时可优先试 Astra low 替代 Sol high、Astra medium 替代 Sol max;成熟工作流不必因为 1 分就切换。按实际任务质量、账单、耗时和返工验收,再决定是否改变主力。

综合能力:五个档位逐一对照(AA v4.2)
指数分 / 美元每加权任务;不是 IQ,也不是一次普通项目的报价
推理档Fable 5.1旧 Fable 5
历史参照
AstraSol
low48(估算) / ——(缺测)49 / $0.6341 / $0.23
medium50(估算) / ——(缺测)52 / $1.1646 / $0.37
high52(估算) / ——(缺测)53 / $1.4148 / $0.61
xhigh54(估算) / ——(缺测)54 / $1.8550 / $0.89
max57 / $6.1253 / $5.6255 / $2.5751 / $1.25

Fable 5.1 的 low、medium、high、xhigh 都被 AA 标为估算,不能当作完整实测曲线。Fable 5.1 各档配置允许回退至 Opus,不能当作绝不切模型的纯单模型成绩。旧 Fable 5 只有 max 有公开数字:53 分、$5.62;配置是 Adaptive Reasoning / Max Effort / Opus 4.8 Fallback,其余四档缺测。旧版仅供已有用户对照,新项目不据此优先选旧版,也不能替 Fable 5.1 的估算档补值。Astra 与 Sol 五档未标估算。不同模型拿到相近指数,只能说在这套综合题附近,不能保证写代码、研究和沟通都相当。

原始结果:Fable 5.1 全档 · Astra 全档 · Sol 全档 · 旧 Fable 5 资料页 · 旧 Fable 5 AA 原页 · 方法变更

真实编程体感:Fable 5.1 五档与 Sol,贵出来的推理值不值?

在 CursorBench 3.2 里,Fable medium 的 68.0% 与 Sol max 的 67.2% 相近。这不是“任何场景都等效”。该榜来自 Cursor 中含糊、多文件的真实任务,未公开配置级样本量和误差区间,不能凭小差距宣布必胜。当前没有 Astra 行,不能替它补分。

CursorBench 3.2 · 9 月 2 日页面 · 任务得分 / 美元每任务
推理档Fable 5.1Sol
low66.2% / $2.9052.6% / $1.01
medium68.0% / $3.5360.0% / $1.95
high69.4% / $4.8063.5% / $2.79
xhigh72.8% / $6.9664.5% / $3.88
max73.4% / $9.6467.2% / $5.69

Fable xhigh → max:得分只增加 0.6 个百分点,平均费用却增加约 38.5%。不能确认这个小增益显著;一般先 high,需要深查用 xhigh,失败代价很高才考虑直接 max。这个建议是基于证据的使用策略,不是承诺。

对比最高档:73.4% 对 67.2%,相差 6.2 个百分点,而每任务账单约多 69%。原榜没有公开“整项任务全对才得分”的二元定义,因此不能解释成每 100 次多完成 6 次,也不能换算失败减少百分比。可理解为:这套多文件编程题的平均表现更高,是否能少返工仍要在自己的项目里验证。

Cursor 原始榜 · 任务与方法

Astra 在终端与长程代码上怎么样?为什么不能只按总分排?

目前支持 Astra 属于前沿执行档,不支持“所有编程任务全面超过 Sol”。DeepSWE 用同一个 mini-swe-agent、同样的提示与命令行工具处理 91 个仓库的 113 项任务;模型需要读文件、改代码并通过测试。

DeepSWE v1.1 · 9 月 3 日 · 单次通过率与每任务账单
实际测试配置通过率美元 / 任务
Astra xhigh74% ±3%$6.52
Sol max73% ±3%$6.46
Opus 5 max74% ±4%$11.84
Gemini 3.8 Flash high74% ±1%$2.36

区间明显重叠,按同一领先档看。Astra 的输出约 30K token、29 步,Sol 约 60K、61 步,但账单几乎一样;Gemini 约 143K、166 步,便宜的单价不等于步骤更少或速度更快。这里尚无 Fable 5.1;旧 Fable 5 的成绩不能继承。

Vals Terminal 2.1 的另一套终端任务:Astra max 87.27% ±0.38、Sol max 85.77% ±1.35、Fable 5.1 max 85.02% ±0.99(含回退)。± 是标准误 SEM,不是 95% 置信区间;这里不据此宣布显著胜负。而 Vals v2 综合指数是 Fable 68.83、Astra 66.61、Sol 63.71;综合指数不是整体任务完成率。AA 的真实 PDF 全标准通过率又是 Astra 33.2%、Sol 28.2%、Fable 26.2%。这正说明“最高总分”不能代替“我这项工作”。

DeepSWE · Vals 终端 · Vals 综合方法 · AA PDF 方法

当前 API 单价:同价的 Fable 和 Astra 为什么账单不同?

AA 费用的白话:它按评测权重、实际输入/缓存、推理和回答 token 折算成平均测评任务费;不是一次网站修改报价,不是成功任务成本,更不是 Codex 会员扣量。Fable 5.1 max $6.12 对 Astra max $2.57 约 2.38 倍,只是 AA 这套评测的口径,不能泛化成每个项目的账单。

标准短上下文 API 价(美元/百万 token):Astra 输入/缓存读/输出为 $10/$1/$50,Sol 为 $4/$0.40/$20。Astra 每 token 约 2.5 倍,但如果少用 token、少重试,差距可能被抵消;大量输入重读时仍可能更贵。Sol 当前促销至少到 2026-11-21,长期预算应另看促销结束、长上下文和缓存写入。

美元 / 百万 token · 标准按量的短上下文基础价;会员扣量另算
模型输入缓存命中输出
Fable 5.1$10$0.25$50
GPT-6 Astra$10$1$50
GPT-5.6 Sol$4$0.4$20
Claude Opus 5$5$0.5$25
Claude Sonnet 5$2$0.2$10
Gemini 3.8 Flash$0.75$0.075$3.75
GPT-5.6 Terra$2$0.2$12
GPT-5.6 Luna$0.2$0.02$1.2

Fable 5.1 缓存命中降到 $0.25。Anthropic 与 OpenAI 另有缓存写入价,Google 另有缓存存储费,工具使用也可能另计。Astra 超过 272K 输入后整次请求采用 $20 / $75 的长上下文档;Sol 对应 $8 / $30、Terra $4 / $18、Luna $0.40 / $1.80。Gemini 3.8 介绍价到 12 月 31 日,2027 年输入 / 输出为 $1.50 / $7.50。Sonnet 5 原计划涨价已取消,$2 / $10 是当前标准价。

速度只支持这次 AA API 测量:Astra low 为 85.7 token/s、首 token 6.64s;Sol high 为 71.9 token/s、首 token 18.83s。它只说明这次测量 Astra 更快,不能承诺整个工程按比例加速;工具等待、输入重读、失败和返工仍要实测。Astra low 原页 · Sol high 原页

OpenAI 价格 · Anthropic 价格 · Google 价格 · 按自己的用量计算 →

前端、代码美术、游戏:哪一个更强?

网页视觉与浏览器游戏首稿,先试 Fable 5.1;完整游戏工程和 3D 美术,目前不能宣布它一定胜过 Astra。这是有边界的试用顺序,不是把两者永久分成“美术”和“程序员”。

按最终交付物区分,不用一张美感榜包办所有工作
你要做的东西建议先试为什么,不能推出什么
网站页面、React 界面、照参考图还原Fable 5.1 high;精细修改再试 xhighArena 的 Fable max 版本有强网页偏好证据,但不能反推 high 同样第一;Astra 尚未在该榜出现。
浏览器小游戏、Canvas 互动作品Fable 做第一版,Astra 独立检查或做另一版Gaming 分榜支持“生成后更受喜欢”,不等于碰撞、胜负、重开、触控和性能全部可靠。
SVG 图形、shader 特效、程序化 3D 场景同一个小场景让两者试做,选更贴近风格的继续有直接演示与可读源码,但缺同预算重复盲测;画面常受 Blender、贴图模型与渲染器影响。
Unity / Unreal / Godot 的完整游戏先按引擎、现有仓库和最小玩法实测,不指定冠军尚无充分同条件对照。状态、物理、存档、资源管理与目标设备表现,不能由网页美感分代替。
展开前端与游戏证据:榜单测了什么,实际案例暴露了什么?

Arena 9 月 4 日:Fable 5.1 max 在 WebDev 总榜为 1763 ±16(2,227 票),Gaming 为 1903 ±37(636 票),React 为 1811 ±20(1,620 票),参考设计为 1819 ±43(356 票),合理名次均为第一。它们是同一平台的一种人类偏好方法,不是四家独立测试;Astra 缺席不等于落败,也不能把 Elo 分数当百分比。

换成检查应用功能的 Vals Vibe Code v1.1:Fable 5.1 max 90.26% ±1.57(含回退),Astra max 89.59% ±2.17。仅差 0.67 个百分点,± 为标准误,不足以给出稳定胜负;该得分不是零返工项目比例,也不是专门的美术评审。

PhiloLabs 公开了两者按同一 brief 制作 Three.js 场景的源码和并排走镜。Fable 一侧包含多阶段、多代理和反复修复,不是“一句话就完美”;其项目自测也记录了某视角约 32 fps 和未完成行为。Astra 也使用 Blender 资产,双方 effort、完整预算、重复次数和对称性能测试未充分公开。这是值得看和试跑的单项目样本,不是本站复现实验或游戏美术冠军证据。

WebDev 原榜 · 浏览器游戏分榜 · React · 参考设计 · 应用功能测试 · 双方场景源码与方法

照着用:两家怎样配合,又不浪费双倍额度?
  1. 先选一位主负责人:网页视觉可先 Fable,终端、长 PDF 或已有 Codex 工程可先 Astra。它既能规划也能实现,不必先强制换手。
  2. 先做一个能判断的样板:网页做一个关键屏幕;游戏做一个输入→反馈→结果→重开的玩法循环。说清风格参考、目标设备、验收和预算。
  3. 第二家只接明确职责:网页检查触控、键盘、响应式与状态;游戏检查碰撞、状态切换、重开/存档和固定设备帧时间。若在选视觉方向,可让另一家做独立样板,而不是再写同一份计划。
  4. 让证据决定是否换主力:主模型理解错或连续修不好时,交给另一家带原文件、差异和失败复现接手;只争风格、没有新问题就停止。
  5. 确实可并行才开子代理:阅读、找反例、测试可拆支线;写入任务划定文件所有权或隔离 worktree,同一文件同一时间只有一个修改者。一个清楚的小任务无需完整多代理流程。

这些是依据任务证据与官方工具方法给出的可验证策略,不是已经证明的万能组合。程序图形与真正的角色原画、贴图、视频素材不同;需要素材时应另选图像/视频工具,不把生成模型的贡献都记到语言模型头上。

OpenAI 编程方法 · Fable 使用方法 · 找真正需要的图像/视频工具 →

最简单的落地方式:只据 AA 与 API 费用做第一次 A/B,可从 Astra low 替代 Sol high、Astra medium 替代 Sol max 试起;成熟工作流不必因为 1 分全部切换,按真实任务质量、账单、耗时和返工验收。限制不必要的高 effort,不等于把旗舰模型日常禁用;强模型已经理解复杂工作且能通过验收时可以继续实现,高风险或认真尝试仍失败再升 high / xhigh / max。Fable 5.1 的低四档是估算,不能证明 Astra low 一定胜;max 综合领先也不等于每个任务都领先。Ultra 仍需另看能否并行,目前没有同条件数据可把 Ultra 换算成 Sol 的某一档。

先按任务做决定

30 秒选择:不是永远逐级升,也不是永远直接 Max

低风险任务先用够用档;失败会造成大量返工时,直接买更高成功率通常更省。
01

开放式难题、复杂规划,优先提高一次做对的机会

Astra medium / high 或 Fable 5.1 high

Astra medium 的 AA v4.2 已略高于 Sol max;Fable 5.1 在 Cursor 多文件任务更强。强模型已经理解复杂工作且能通过验收时可以继续实现;按自己的质量、账单、耗时和返工复测,关键尾部再升 xhigh / max,不把单榜接近当全面等效。

02

能力接近,先比较 Astra 与 Sol 的费用

Astra low 对 Sol high;Astra medium 对 Sol max

只据 AA v4.2 可把这两组当拿相同任务试用两者(A/B 对照)的价格起点;成熟工作流不因 1 分全部切换。限制不必要的高 effort,不等于禁用旗舰;高风险或认真尝试仍失败时升级,并用真实账单、耗时和返工决定是否切换。

03

日常严肃编程,只想设一个默认档

Sol high

这是质量与成本平衡的起点;简单任务降 medium,核心语义仍做不对时升 Astra / Fable 5.1,不只反复堆 Sol effort。

04

测试成熟,想压低成功任务成本

Gemini 3.8 Flash high;既有流程可试 Terra max

Gemini 3.8 在两条独立代码方法兼具较强能力和较低平均费用;Token、步骤与返工仍需实测。Terra 的 Radar 优势来自 7 月历史快照。

05

摘要、仓库扫描、日志、证据整理、批量助手

Luna medium / high

要求它返回原文、路径与未确认项;计划已冻结且测试可靠时可试 xhigh / max 执行,复杂综合仍交给主模型。

06

强模型已经写清计划,想大幅压低批量实现成本

GLM-5.3 Flash max / Luna xhigh—max

强模型先写计划和验收,低价模型执行明确、可回滚工作;认真尝试仍理解错就回到 Astra / Fable 5.1 / Sol / Opus。按实际可用工具与成功任务成本选,不永久限定模型职业。

07

架构、安全、复杂迁移、最终质量门

Astra high / xhigh 或 Fable 5.1 high / xhigh

预算受限可保留 Sol xhigh。若一次失败的返工已比升档更贵,可直接 max;不必机械逐级试。测试与独立复核仍不可省。

08

研究或工程能拆成多条互不阻塞的支线

先写 2—4 条独立任务

每条有独立产物和验收时再开 Ultra / Agent team;共享同一文件就串行。

09

还在使用 GPT-5.5 high / xhigh

先拿 15—30 个真实任务做迁移 A/B

优先比较 Sol high、Terra max;语义等价和审查质量不要只看测试绿不绿。

先把名词分开

换模型、加推理、开多人,不是在买同一种东西

理解这些区别,才能知道钱花在“更强的大脑”、更多工作步骤,还是更多并行代理上。

模型

决定能力上限。Sol、Terra、Luna 是三颗不同的“大脑”,不是同一模型的快慢档。

模型权重与能力层级不同;换模型会改变每 token 单价、知识与推理上限。

Effort / 推理强度

决定这颗大脑愿意花多少步骤读文件、试方法、用工具和复查。

它会改变推理、工具调用、验证与输出 token,因而改变整项任务成本。

Max

一个模型自己把难题想得更久、更深。

GPT-5.6 的最高单代理 effort;GPT-5.5 不支持 Max。

Ultra

一个负责人同时安排多名助手并行,不是简单的“Max 再加一级”。

OpenAI 默认协调 4 个代理;总成本包含所有代理 token,只有任务可并行时才可能更快。

Pro / Fast

Pro 是另一种高质量服务模式,Fast 是加速;都不能和 effort 混为一谈。

Pro mode 独立于所选模型/effort;Codex Fast 提高速度与 credits 消耗,不会换模型权重。

先把最容易误解的话讲明白

“边界清楚、验收明确”到底是什么意思

大白话:模型要知道该做什么、不能动什么,以及你会怎样检查。它不是要求用户一开始就会写技术方案。
先说结论

把语音需求聊清楚会明显提高 Sol medium、Terra 等预算档的成功率,但不会把它们“聊成”更强模型。任务越模糊、隐含取舍越多,越值得先让强模型整理成计划;任务越简单、测试越硬,预算模型越有机会发挥价格优势。

01

要改什么

把结果说成一句可以检查的话,例如“在套餐页新增按用途筛选,并保留原价格数据”。

交付物、目标路由、输入输出与成功状态。
02

哪里能改、哪里不能动

列出文件、页面和不能碰的内容;不要只说“把网站优化一下”。

作用域、非目标、权限边界、兼容约束。
03

怎样算做完

写出能直接执行的检查:哪条命令要绿、哪个页面在手机上不能溢出、哪段文字必须出现。

验收测试、视觉视口、期望输出与回归门。
04

什么时候停下来

遇到数据冲突、会覆盖已有改动或需要新权限时先报告,不自己猜。

停止条件、升级条件与失败恢复。
2026-07-24 官方能力核验

现在都能“用语音”,但两家不是同一种功能

先看你要的是实时指挥代理、把口述变成提示词,还是普通语音聊天。入口相似,不代表工作方式相同。

实时语音操控

ChatGPT Work / Codex

想边说边指挥任务、随时打断和追问进度,优先用它。

ChatGPT 桌面端的 Voice 可以进入 Work 或 Codex,沿用当前工具和权限启动、协调任务。它是语音交互入口,不应写成 Codex 单独换了一个“语音模型”。

目前面向符合条件的 macOS / Windows 桌面账号逐步开放;一次只能进行一场语音对话,Codex 也不能在网页或手机端直接新建。OpenAI 官方说明
语音听写提示词

Claude Code

想少打字、先口述需求再检查文字,Claude Code 的 /voice 更合适。

语音会实时转成输入框里的文字,可与键盘混合编辑,再作为普通提示词发送;当前官方文档没有把它描述成持续用语音回答的双向编程通话。

音频会发送到 Anthropic 服务器转写,不消耗 Claude 消息或 token;需要 Claude.ai 登录和本地麦克风,不适用于 API Key、SSH、网页远程环境。Claude Code 官方文档
完整语音对话

普通 Claude

只是想与 Claude 说话并听语音回答,用普通 Claude 的 Voice mode。

Claude 网页和移动端的 Voice mode 支持用户说话、Claude 语音回答和中途打断,但它与 Claude Code 的代码工作区、终端工具和语音听写是不同产品层。

不要把普通 Claude 的双向语音能力写成 Claude Code 已经具备同样的语音代理控制。Claude Voice 官方说明

一句话选择:想边说边让编程代理开工、打断和协调,选 ChatGPT 桌面端的 Codex Voice;想口述一段可检查的代码需求,选 Claude Code /voice;想正常语音聊天,选普通 Claude Voice。

同口径数据

Sol、Terra、Luna 与 GPT-5.5 各档差多少

AA 回答广泛能力与推理投入;Distributed Codex Radar 回答 112 个真实仓库任务在固定历史快照中的表现。两者不能互相替代。

当前查看

GPT-5.6 Sol

普通严肃工作从 medium / high 起步;xhigh、max 留给难题和终审。当前促销价至少持续至 2026-11-21。
输入
$4/M
缓存输入
$0.4/M
输出
$20/M
单模型推理

Low

AA v4.1.1 历史快照51整套评测成本 $256
Radar 7/23 固定通过率48%换成 100 个同类任务,该快照约完成 48 个 · 汇总 323 次有效判分
AA 输出量
6.6M token
AA 首 token
2.53 秒
Radar 历史用量估价
$1.93
Radar 7/23 单题耗时
8.8 分钟

读文件、定位范围、低风险小改;不要把它当复杂仓库默认档。

单模型推理

Medium

AA v4.1.1 历史快照56整套评测成本 $429
Radar 7/23 固定通过率60.7%换成 100 个同类任务,该快照约完成 61 个 · 汇总 333 次有效判分
AA 输出量
12M token
AA 首 token
6.85 秒
Radar 历史用量估价
$3.36
Radar 7/23 单题耗时
13.8 分钟

目标、文件边界和验收测试都写清楚时可做日常工程;模糊需求仍可能受规划上限影响。

单模型推理

High

AA v4.1.1 历史快照57整套评测成本 $700
Radar 7/23 固定通过率62.7%换成 100 个同类任务,该快照约完成 63 个 · 汇总 327 次有效判分
AA 输出量
21M token
AA 首 token
21.1 秒
Radar 历史用量估价
$4.95
Radar 7/23 单题耗时
19.1 分钟

多文件实现、需要主动查漏和核验的主力档;当前促销后仍是最省心的通用起点。

单模型推理

xhigh / Extra High

AA v4.1.1 历史快照59整套评测成本 $1,108
Radar 7/23 固定通过率63.3%换成 100 个同类任务,该快照约完成 63 个 · 汇总 330 次有效判分
AA 输出量
35M token
AA 首 token
58.32 秒
Radar 历史用量估价
$6.44
Radar 7/23 单题耗时
23.8 分钟

架构、安全、复杂迁移、语义等价和终审;不要只为“更放心”长期常开。

单模型推理

Max

AA v4.1.1 历史快照61整套评测成本 $2,017
Radar 7/23 固定通过率67.3%换成 100 个同类任务,该快照约完成 67 个 · 汇总 336 次有效判分
AA 输出量
70M token
AA 首 token
163.17 秒
Radar 历史用量估价
$9.14
Radar 7/23 单题耗时
33 分钟

最难且高价值的尾部任务。若一次失败的时间或损失已高于升档成本,可以直接跳到 Max,不必机械逐级试。

多代理编排

Ultra

AA v4.1.1 历史快照整套评测成本
Radar 7/23 固定通过率66.1%换成 100 个同类任务,该快照约完成 66 个 · 汇总 336 次有效判分
AA 输出量
AA 首 token
Radar 历史用量估价
$19
Radar 7/23 单题耗时
49.6 分钟

只给可并行的研究、竞争假设、审计或独立模块;同一条串行代码链通常不划算。

三种“成本”不能混看

模型卡顶部是 API 每百万 token 挂牌价。AA v4.1.1 是历史题集,不能与本页上方的 v4.2 相减;“整套评测成本”也不是上方的加权单任务费。Radar 保留 7 月 23 日固定用量,Terra / Luna 按 7 月 30 日价机械折算,Sol 账单早于当前促销,不能理解为重新跑过或今天的发票。Ultra 没有 AA 同口径分数,明确留空。

自选 1—6 个档位

把“能力、通过率、成本、等待”拆开看

这是历史工作流对照:AA v4.1.1 与 7 月 23 日 Radar 固定快照,不与上方 v4.2 相减。条形图一次只比较一个指标,旧账单不当今天的发票。

把差距翻译成体感先看当前结论,再在下方更换 1—6 个候选
100 个同类仓库任务

Terra Max 比 Luna High 该快照大约多完成 24 个。

历史用量估价

Luna High 比 Sol High 该快照平均少约 $4.74。

历史每题等待

Sol Medium 比 Terra Max 该快照平均少等约 15.0 分钟。

“100 个任务”只是把百分点改写成容易理解的单位,不是预测你的下一次任务;任务、工具、提示和测试改变后,差距可能缩小、放大或反转,也不能换算成人类智商。

Sol
Terra
Luna
GPT-5.5

已选 5/6 个;至少保留 1 个。达到上限后,先取消一个再添加。

Radar 7/23 固定通过率这个指标越高越好
Sol Medium
60.7%
Sol High
62.7%
Terra xhigh / Extra High
56.7%
Terra Max
67.0%
Luna High
43.3%
当前选中模型与推理档的完整数据
模型与档位AA 分AA 整套成本Radar 通过率Radar 历史估价Radar 历史耗时
GPT-5.6 Sol · Medium56$42960.7%$3.3613.8 分
GPT-5.6 Sol · High57$70062.7%$4.9519.1 分
GPT-5.6 Terra · xhigh / Extra High52$72856.7%$1.8516.4 分
GPT-5.6 Terra · Max55$1,64867.0%$3.6228.8 分
GPT-5.6 Luna · High46$5543.3%$0.2115.7 分

想比较不同厂商、上下文、价格和正式能力资料?这里先看推理档;跨厂商正式对比仍使用 2—4 模型对比页。

打开多模型对比 →
Artificial Analysis

像“多科综合考试”:旧交互表保留 v4.1.1 固定快照;页首前沿对照与首页总榜使用 v4.2。新旧题集不能相减,估算不能当实测,整套成本也不是普通用户一次任务的价格。

Distributed Codex Radar / DeepSWE

像“固定仓库上机考试”:每个模型 × 推理档 × 任务格保留近期最多 3 次有效判分;页面通过率按所有 p / n 汇总。这里的通过率、耗时和单题账单都冻结在 7 月 23 日,用于解释任务差异;Sol 当前促销与后续价格变化必须用自己的 token 日志另算。

为什么两个榜单会“打架”

综合能力更高,不保证在固定工具链里通过更多;反过来也一样。约 1 分、少量任务或样本重叠时按同档,再看自己的任务。

把数字翻译成决定

先给结论,再展开“为什么”

这里不用弹窗遮住表格:每条结论都能原地展开、上下滚动,也能直接通过锚点分享。
边界清楚时怎么省

Sol medium 与 Terra xhigh 不是“效果一样”

优先省心选 Sol medium;需求和验收都很清楚、能接受略低成功率时,Terra xhigh 在 7 月 23 日固定仓库快照中的单题账单约低 45%。Sol 8 月促销会缩小价差,最终应按自己的 token 结构重算。

换成体感:按固定 Radar 快照,100 个同类仓库任务里 Sol medium 大约多完成 4 个;旧账单中 Terra xhigh 每题少约 $1.51、但多等约 2.6 分钟。这个账单早于 Sol 当前促销,不能直接当今天的发票。

  • 历史 AA v4.1.1 综合分:Sol medium 56,Terra xhigh 52
  • 历史 Radar 7/23 通过率:60.7% 对 56.7%,相差 4.0 个百分点
  • 历史 Radar 同用量价格折算:$3.36 对 $1.85;平均等待 13.8 对 16.4 分钟
  • 历史 AA v4.1.1 整套评测成本:$429 对 $728;Terra 输出更多,整套仍贵约 70%

更偏左边:语音需求还比较散、模型需要自己补全范围,或你不想花时间盯执行过程。

更偏右边:文件范围、禁止事项、输入输出和验收命令都已写清,失败会被测试可靠拦住。

为什么这样判断?

两者只是两个可用起点,不是能力等价。AA 与 Radar 都把 Sol medium 放在前面。

Terra 的优势是单题账单,不是更快:当时降价后价差扩大,但平均等待仍约多 19%。

如果让更强模型先写清计划和验收,再交给 Terra 执行,通常能减少需求歧义;但不会消除 Terra 自身的推理上限。

一个默认档怎么选

Sol high 更省心;Terra max 更像“有测试的耐心执行者”

模糊、多变、需要主动判断时选 Sol high;测试强、任务边界稳、愿多等一会儿时,Terra max 在固定仓库轨道通过更多。Sol 当前促销已让旧成本优势明显缩小,不能再默认 Terra 一定更便宜。

换成体感:100 个同类仓库任务里,Terra max 的固定快照大约多完成 4 个;旧账单每题少约 $1.33、平均多等约 9.7 分钟。Sol 新促销后成本需重算,换一套任务方向也可能反转。

  • 历史 AA v4.1.1 综合分:Sol high 57,Terra max 55,属于相邻档而非完全相同
  • 历史 Radar 7/23 通过率:62.7% 对 67.0%,Terra max 高 4.3 个百分点
  • 历史 Radar 同用量价格折算:$4.95 对 $3.62;平均等待 19.1 对 28.8 分钟
  • 历史 AA v4.1.1 整套评测成本:$700 对 $1,648;Terra max 在广泛任务中仍用了更多输出

更偏左边:只想设一个日常默认档、需求经常来自语音或多轮补充、等待时间也重要。

更偏右边:工程测试成熟、失败能被拦截、等待不是主要成本,并愿意按自己的仓库复测。

为什么这样判断?

AA 覆盖更广,偏向 Sol;Radar 是固定仓库代理任务,偏向 Terra max。它们测的不是同一件事。

指数点不是“智力百分比”。这里应同时看 2 点的历史综合差、4.3 个百分点的任务差、成本和等待。

CodeRabbit 的另一组 100+ 任务里 Sol 63.7%、Terra 40.7%,说明 harness、提示和任务形状足以反转结论。

High、xhigh、Max 怎么升

不必每次逐级试;看一次失败到底有多贵

普通任务先 high;架构、安全、迁移和语义终审直接 xhigh;若一次失败会浪费数小时、造成重大返工或结果难验证,可以直接 Max。

换成体感:high 到 xhigh 在 7 月 23 日历史快照的 100 个同类任务里不到多完成 1 个,却每题多约 $1.49、等 4.7 分钟;xhigh 到 Max 大约多完成 4 个,再多约 $2.70、等 9.2 分钟。

  • 历史 AA v4.1.1:high 57 → xhigh 59 → max 61
  • 历史 Radar 7/23:62.7% → 63.3% → 67.3%
  • 历史 Radar 平均单题:$4.95 → $6.44 → $9.14
  • 历史 Radar 平均等待:19.1 → 23.8 → 33.0 分钟

更偏左边:高到 xhigh:多付约 30% 历史单题成本,主要买更充分的语义、架构与审查。

更偏右边:xhigh 到 Max:再多付约 42%,历史仓库轨道多 4.0 个百分点;只对高价值尾部划算。

为什么这样判断?

低风险任务失败后再升档通常更省;失败会造成大额时间损失时,重复跑本身也有成本。

Max 不是“永远最后一步”。决定是否跳档,应比较升档费与失败后的重跑、人工返工和机会成本。

Ultra 是多代理并行,不在这条单代理阶梯上。不能拆成独立支线时,Ultra 不会自动比 Max 更聪明。

AA 与 Radar 为什么打架

Terra max 与 Sol xhigh:先问你在做哪种任务

开放判断、广泛知识与更快周转偏 Sol xhigh;固定仓库和强测试可能偏 Terra max。成本方向要用当前 Sol 促销与自己的输出长度重算。

换成体感:7 月 23 日历史快照的 100 个同类仓库任务里,Terra max 大约多完成 4 个;按历史价格折算每题少约 $2.82,但多等约 5 分钟。这不能外推成开放式任务也更强。

  • 历史 AA v4.1.1 综合分:Sol xhigh 59,Terra max 55
  • 历史 Radar 7/23 通过率:63.3% 对 67.0%
  • 历史 Radar 同用量价格折算:$6.44 对 $3.62
  • 历史 Radar 平均等待:23.8 对 28.8 分钟

更偏左边:需求含大量隐含取舍、要自己发现边界,或任务并不只是改仓库和跑测试。

更偏右边:输入和成功条件固定,工具链成熟,最终结果能由自动化验收。

为什么这样判断?

AA 更像多科综合考试;Radar 更像同一套真实仓库上机考试。

一个模型可以综合能力更高,却在特定上机环境中没有更高通过率;这不是数据错误。

企业上线应优先使用自己的任务成功率,公开榜单只负责帮你缩小候选范围。

Luna 读文档够不够

Luna high 能读和整理,但不应独自做最终判断

Luna medium / high 继续做材料助手;降价 80% 后,计划已写清、测试可自动验收的批量实现可试 xhigh / max,但最终方案和关键代码仍由 Sol / Claude 主模型批准。

换成体感:7 月 23 日历史快照的 100 个同类仓库任务里,Luna max 约完成 59 个、Sol medium 约完成 61 个;按历史价格折算每题约 $0.49 对 $3.36,但 Luna 平均多等约 18.5 分钟。它是低价执行候选,不是更聪明的主脑。

  • 历史 AA v4.1.1 综合分:Luna medium 38,high 46,max 51
  • 历史 AA v4.1.1 GPT-5.5 high 为 53;不能把 Luna high 说成与其全面等价
  • 历史 Radar 7/23 通过率:Luna high 43.3%,max 59.0%,GPT-5.5 high 55.7%
  • 历史同用量价格折算:Luna high 约 $0.21 / 题,max 约 $0.49 / 题
  • 同一仓库轨道的接近或反超,不等于所有领域智力相等

更偏左边:Luna 独立完成:逐条抽取、去重、分类、文件地图;或执行已冻结计划、补测试和跑验收。

更偏右边:强模型接手:澄清模糊需求、决定证据是否可信、解释矛盾、设计架构和最终批准。

为什么这样判断?

只读不是“完全不用思考”,但任务能拆成可核对的小结果,降低了对总体判断能力的要求。

让 Luna 报告文件路径、原句、行号和未确认项,比让它直接写结论可靠。

OpenAI 现在也建议由 Sol 解决不确定性和写计划,再让 Luna 执行明确改动、补测试并运行验收;独立 Radar 数据则说明这条路线必须保留测试兜底。

开 Max 前先问

真正要比较的是“升档费”和“失败后的总损失”

这四项满足得越多,越可以跳过逐级尝试;否则从 high / xhigh 开始通常更合算。

  1. 这是单条难题,而不是可以拆开的多条支线吗?是:优先 Max;否:再考虑 Ultra。
  2. xhigh 已经在相同环境失败,且失败不是缺文件、权限或测试配置造成的吗?
  3. 一次失败会浪费数小时、造成高额返工,或结果很难被自动验证吗?
  4. 你能写出 Max 应额外检查的风险,而不是只想“更放心”吗?
技术论坛给出的不是“新榜单”,而是使用风险提示

社区同时报告 Sol 的强执行力,以及范围膨胀、等待过长等问题。论坛环境不可控,所以只提炼三条可验证规则:任务分阶段、提前写停止条件、关键结果由测试和独立审查确认。

Luna 实际怎么干活

Luna high 能读、能整理,但不能独自替你拍板

历史 AA v4.1.1 中 Luna high 为 46、GPT-5.5 high 为 53;7 月 23 日 Radar 为 43.3% 对 55.7%。这些不是当前 v4.2,也没有可靠证据把它直接换算成“GPT-5.4 high”或“GPT-5.5 的某一档”。
01

Medium:搬运与目录

逐条抽取、去重、分类、文档目录和固定格式草稿。要求返回原文、路径与未确认项。

02

High:只读分析助手

仓库地图、日志解释、测试失败归因和来源初筛。它可以思考,但不承担跨来源的最终取舍。

03

主模型:综合与批准

Sol / Claude 决定证据可信度、架构、关键补丁和最终结论;不要让整理材料的助手批准自己。

子代理 / subagent

官方接口说明 ↗
当前能不能用
ChatGPT Work 与 Codex 支持;可显式要求主模型分派。
推荐用法
让 Luna high 只读扫描仓库、整理文档、归类日志、核对来源;主模型保留决策与最终写入。
不要这样用
多个代理同时改同一文件,或把模糊架构问题直接交给廉价助手。

新任务 / 新对话

官方接口说明 ↗
当前能不能用
同一项目可开独立任务;相关上下文不会自动等于当前长对话。
推荐用法
每个明确结果单开一项:例如“建立仓库地图”“复核测试失败”“整理来源目录”。
不要这样用
把同一个需要连续上下文的调试链拆散,导致每项都重新理解背景。

Git worktree

官方接口说明 ↗
当前能不能用
Codex 桌面端可为独立任务和自动化使用隔离 worktree。
推荐用法
当 Luna 或其他子代理必须写代码时,让每名写入者拥有独立工作目录,再由主线程合并。
不要这样用
只建分支却让多个代理共用同一工作目录;分支名并不能隔离未提交文件。

定时任务 / automation

官方接口说明 ↗
当前能不能用
Codex 桌面与网页可管理;本地项目 / worktree 类型目前由桌面端配置。
推荐用法
固定检查清单、依赖状态、测试报告、来源可用性等可复现任务;候选结果先人工审核。
不要这样用
让自动化未经审核就发布新模型结论、价格或排行榜。CLI / IDE 也没有同等管理界面。

线程、子代理、worktree 与多人模式

先分清它们解决什么问题,再组合

结论:上下文隔离、工作分派、文件隔离和并行协作是四件事。工具越多,不代表任务自动更聪明。

任务 / 线程

单独的一项工作和独立上下文。
什么时候用
目标不同、需要较长连续思考,或不希望大量材料干扰当前主线时新开。
它不解决什么
它不会自动共享当前对话的全部细节;交接要写目标、事实和产物。

子代理

主模型临时派出的专职助手。
什么时候用
并行读来源、扫仓库、跑独立核对或做反方证据;返回可核查结果给主线程。
它不解决什么
子代理的答案是材料,不是最终批准。廉价模型尤其要返回路径、原文和未确认项。

Worktree

给写代码的人一间独立工作室。
什么时候用
多个代理必须同时改不同模块时隔离未提交文件,再由一个负责人合并。
它不解决什么
它只隔离文件,不提高智力;多人改同一文件仍会冲突。

Ultra / Agent team

多名代理同时推进可分开的支线。
什么时候用
竞争假设、独立来源、不同模块、实现与测试能真正并行时使用。
它不解决什么
共享一条串行链、同一文件或每步都依赖上一步时,多代理只会增加沟通和总 token。

自动化

按时间重复执行固定清单。
什么时候用
状态检查、依赖变化、来源可用性和标准测试等规则明确的任务。
它不解决什么
它不是“自动变聪明”;新模型发布、规则改变和结论解释仍需人工或 AI 复核。
一套能直接照做的流程

从一段不完整的语音需求,到可审核交付

  1. 主线程澄清:把语音整理成目标、非目标、风险和验收,不急着实现。
  2. 只读支线:子代理分别查仓库、来源和反例;便宜模型只交付证据,不下最终结论。
  3. 负责人定计划:强模型解决冲突、冻结接口和文件所有权,判断串行还是并行。
  4. 隔离实现:独立模块才开 worktree / 团队;同一核心文件由一名执行者负责。
  5. 独立验收:机器测试先跑,另一家模型只读审查,最后由主线程合并并总结限制。

反方论证和缺口搜索可以交给便宜子代理;它的价值是提醒主模型“可能漏了什么”,不是把廉价答案当最终裁决。只有高风险决策才值得再用昂贵模型做第二次反证审计。

Claude Code 对照

先看你正在做什么,再搭配 Claude、Astra 与执行模型

前沿候选是 Fable 5.1 与 Astra;Sol、Opus 5、Gemini 3.8 等按成功任务成本保留。视觉方案可试 K3,不把模型固定分成“只规划”或“只执行”。
30 秒任务分流

不用记榜单:找到最像你当前工作的那一张

每张卡先给能直接照做的选择,再保留技术证据。模型只是起点;范围、测试、检查点和审查决定最终能不能放心交付。

边聊边把想法做清楚

产品构思、MVP、模糊需求

Fable 5.1 high 或 Astra medium / high

先让强模型把目标、约束和可验证结果做清楚。预算平衡可从 Opus 5 high / Sol high 起;核心语义理解失败时换强模型,而不是反复重跑。

Fable 5.1 有 Cursor 模糊多文件实测;Astra 有 AA 工作任务与长程代码信号,但未在当前 CursorBench 出现。不能由榜单把它们固定成产品或编码的专职角色。
工程闭环优先

后端逻辑、终端、测试与部署

Sol high;高价值难题用 Astra high / xhigh

已有命令、测试和日志时,Sol 仍是可靠预算起点。Astra 在固定长任务框架用更少输出与步骤到达相近通过率,值得在复杂任务复测。

DeepSWE:Astra xhigh 74%±3 / $6.52,Sol max 73%±3 / $6.46;误差重叠。普通 Token 单价高 2.5 倍,并未让这条平均任务账单也高 2.5 倍。
视觉完成度优先

前端、网页、互动原型

Fable 5.1 high;Opus 5 / K3 作为任务 A/B

先做一个能运行的代表页面,再检查视觉、响应式与交互。不要把一次漂亮演示当成可上线的完整产品。

Fable 5.1 的 Cursor 与 Vals 应用信号支持候选资格;K3 保留视觉、React、3D 专项。两者都需要同视口截图、构建与真实操作验收,不能据此宣布所有前端任务第一。
问题根因不清楚

Debug、疑难 Bug、因果分析

先找复现与反例,再按失败代价选模型

能稳定复现的小问题可用 Sol 或明确任务执行者;根因模糊、跨系统或失败昂贵时用 Astra / Fable 5.1。语气自信不是因果正确。

目前没有同口径证据支持 Debug 一律属于某模型。让它给出假设、最小复现和可区分原因的实验;认真尝试仍理解错核心语义时换强模型。
长时间无人值守

长循环、跨文件任务、后台代理

Astra / Sol;Gemini 3.8 Flash 作为成本候选

先建立可恢复检查点、有效权限和验收。谁能安全持续完成你的任务,要靠同任务试跑,不由模型性格或最大上下文决定。

DeepSWE 9/3:Astra xhigh 74%±3、Sol max 73%±3、Gemini 3.8 high 74%±1,区间重叠。Gemini 平均 $2.36 但 166 步;Fable 5.1 暂无同版本 DeepSWE,不能继承旧 5。
代码审查与上线门

实现者自测,再由独立模型查漏

Astra / Sol 实现可用 Claude 复核;反向亦然

先完成实现者自测,再让没有参与实现的模型找反例和可复现问题;独立复核不是禁止自审,更不能代替测试。

Fable 5.1 的 CodeRabbit 两种配置没有显示升档普遍增益,且不能直接对排不同时间和 pipeline 的 Sol 数据。高风险动作继续服从实际授权与发布门。
常见说法交叉核对展开看:哪些方向对,哪些说得太满
已过时

Fable 只比 Opus 贵,日常都该用 Opus

旧 Fable 5 不能代表 5.1。新版已有更强 Cursor 多文件信号,普通输入 / 输出仍为 Opus 两倍,但缓存读取是 Opus 的一半;真实成本取决于任务和用量。

说得太绝对

Claude 负责产品,OpenAI 负责纯编码

它们都能规划、实现和审查。Fable 5.1 在 Cursor 多文件任务靠前,Astra 在终端和 PDF 任务领先的点位更高;这是评测与任务差异,不是固定职业分工。

必须分评测

Fable 5.1 medium 就等于 Sol max

CursorBench 68.0% 对 67.2% 只是相邻点位;AA v4.2 的 Fable medium 是 50(估算),Sol max 为 51。API、代理框架、档位和任务不同,不能写成通用等价。

需要看边际收益

最强模型直接开 max 最省心

Fable 5.1 在 Cursor 从 xhigh 升 max 只增加 0.6 个百分点,平均费用多约 38.5%;差异未必显著。关键失败足够昂贵时仍可以直上 max,不机械逐级试。

不能按单价推断

Astra 比 Sol 贵 2.5 倍,所以任务也贵 2.5 倍

普通输入 / 输出单价如此,但 DeepSWE Astra xhigh 与 Sol max 的平均费用为 $6.52 对 $6.46,通过率区间重叠;Astra 输出和步骤更少。换到 AA v4.2 max 又是 $2.57 对 $1.25。

模型档位与编排分开

Ultra / ultracode 就是比 max 更高的独立分数

Ultra 属于多代理编排;Claude Code ultracode 当前发给模型的是 xhigh 并组织工作流。它们没有可直接继承的 max 成绩,也不适合靠并行加速每一条串行难题。

Claude Fable 5.1

当前 Claude 前沿主力;复杂多文件、研究和长交付候选

API / 1M token
$10 输入 / $50 输出;缓存读取 $0.25
建议起点
API / Claude Code 从 high;日常可 A/B medium,难题升 xhigh
边界
CursorBench 已有五档实测,xhigh 到 max 只多 0.6 个百分点、平均费用多约 38.5%。AA 除 max 外四档为估算,AA / Vals 含安全回退;不要当纯模型完整实测曲线。

Claude Opus 5

成熟的 Claude 质量与成本平衡主力

API / 1M token
$5 输入 / $25 输出
建议起点
日常从 high;编程 / Agent 能力敏感时试 xhigh
边界
普通输入和输出是 Fable 5.1 的一半,缓存读反而更贵;按任务、缓存构成与返工比较。范围和验证应与风险相称,不因更强模型上市就否定已验证的流程。

Claude Sonnet 5

边界明确的日常主力、批量执行与团队成员

API / 1M token
$2 输入 / $10 输出标准价;原定涨价已取消
建议起点
high;成本敏感降 medium,最难编码升 xhigh
边界
清单、测试和边界都明确时仍更经济;不要因为 Opus 5 上线就把所有重复执行任务一律升档。

Claude Fable 5(旧版)

旧版历史基线;API 仍 Active

API / 1M token
$10 输入 / $50 输出
建议起点
既有稳定流程可暂留;新任务先试 Fable 5.1
边界
旧版成绩不继承给 5.1;新版普通输入 / 输出同价,但缓存读取由 $1 降至 $0.25。不是所有 Token 都降价 75%。

Claude Opus 4.8

成熟旧流程与历史对照

API / 1M token
$5 输入 / $25 输出
建议起点
已有稳定流程可暂留 high / xhigh
边界
官方仍提供,但新任务应先 A/B Opus 5;不要把旧连续观测曲线当作 Opus 5 的成绩。

Claude Haiku 4.5

快速、便宜的分类、搜索和窄任务助手

API / 1M token
$1 输入 / $5 输出
建议起点
按任务使用默认配置
边界
不承担关键架构或无人复核的复杂实现。
Opus 5 历史 AA 档位曲线 · 2026-07-25 原存档

先从 high 开始;升档买的是更长思考,不是固定比例的“智力”

保留旧方法的原始快照,仅用于追溯当时升档成本;不能与当前 v4.2 或 Fable 5.1 的新表相减。整套账单不是一次普通任务价格。

Low51AA 分

分类、抽取和低风险辅助;不要独自处理高风险开放任务。

整套成本
$556
输出量
12M
Medium56AA 分

清楚、可验收的日常任务;在 Cursor 多文件任务中已与 Sol xhigh、Terra max 同档。

整套成本
$1,115
输出量
29M
High59AA 分

Opus 5 的 API 与 Claude Code 默认档;本表仅保留历史 AA 曲线,当前前沿比较看 v4.2。

整套成本
$1,974
输出量
52M
xhigh60AA 分

困难编程、架构和长链路;只有 high 的失败代价明显时再升。

整套成本
$2,910
输出量
76M
Max61AA 分

关键尾部和自己的 A/B 证明确有收益时使用;不是“默认更稳”的常开档。

整套成本
$3,836
输出量
100M

怎么用:需求清楚、结果易验收先 medium / high;困难编程、架构和长链路再用 xhigh。当前 CursorBench 的 Opus 5 high → xhigh 从 66.7% 到 69.3%,费用约增 88%;xhigh → max 多 0.7 个百分点、费用约增 12%。这是 Opus 5 的具体任务数据,不能套给 Fable 5.1 或 Astra。

CursorBench 3.2 · 模糊多文件任务

分数和一次任务平均花费,要放在一起看

分数越高表示在这套 Cursor 任务里完成得更好;费用已按各模型的输入、缓存写入、缓存读取和输出挂牌价计算。它不是通用智商,也不是你的固定账单。

能力优先起点Fable 5.1 high

CursorBench 69.4% / $4.80;API / Code 官方默认 high。medium 为 68.0% / $3.53,可先在自己的日常任务复测。

跨厂商同档Fable 5.1 low—medium 对照 Sol max

CursorBench 为 66.2%—68.0% 对 67.2%;这是同一产品里的相邻点位,不是所有任务能力等价,也不能套到 AA 估算档。

验收清楚时省钱Gemini 3.8 Flash medium / high

CursorBench 为 67.0% / $1.93 与 69.2% / $2.38;强计划加可靠验收后是较低成本候选,不能只看每 Token 单价。

最后一档xhigh 再升 Max

Fable 5.1 从 72.8% 到 73.4%,只多 0.6 个百分点;平均费用从 $6.96 到 $9.64,多约 38.5%。自己的失败损失决定是否值得。

查看 113 个原创长程代码任务:Opus、Sol 与 K3 是否真有固定分工

DeepSWE v1.1 在同一 mini-swe-agent 上运行 113 个原创任务。通过率区间重叠时不判唯一冠军;成本、输出和步骤越低,表示在这套任务里更节制,不代表所有项目都更快。

Astra xhigh74%±3任务通过率
平均成本
$6.52
输出 token
30k
Agent 步数
29

与 Sol max 区间重叠、平均费用相近,输出约一半、步骤不到一半;不能据此保证每个真实项目都更快或更便宜。

Gemini 3.8 Flash high74%±1任务通过率
平均成本
$2.36
输出 token
143k
Agent 步数
166

进入同一长程代码领先档且平均费用较低;更多 Token 和步骤仍有等待与失败恢复成本,不是所有任务的无条件替代。

Opus 5 max74%±4任务通过率
平均成本
$11.84
输出 token
118k
Agent 步数
99

与 Astra、Gemini 3.8 同为 74% 点位,区间重叠;不能单凭取整点位宣布唯一冠军。

Sol max73%±3任务通过率
平均成本
$6.46
输出 token
60k
Agent 步数
61

与 Opus 同档;当前促销后成本更低、输出更短、步骤更少,适合可自动验收的工程闭环。

Fable 5 xhigh(旧版)70%±3任务通过率
平均成本
$13.41
输出 token
80k
Agent 步数
68

这是旧 Fable 5;当前原榜未出现 5.1,不得换名继承。旧版账单也不能当新版缓存优惠后的费用。

GLM-5.3 max69%±3任务通过率
平均成本
$3.99
输出 token
80k
Agent 步数
124

与 K3 同点且区间重叠,已进入开放权重前沿;成本低于 Sol / Opus,但步骤明显更多。

K3 max69%±5任务通过率
平均成本
$4.65
输出 token
81k
Agent 步数
98

也处在同一宽置信区间;低挂牌价带来较低账单,但步骤和输出仍偏多。

Grok 4.6 medium67%±2任务通过率
平均成本
$3.45
输出 token
Agent 步数

与 GPT-5.5 xhigh、Luna max 同点位;价格仍有优势,但没有复现 CursorBench 的最高点位。

Luna max67%±4任务通过率
平均成本
$0.61
输出 token
Agent 步数

长程通过率已到可用区间且成本很低;仍需强计划和测试,不能把这条轨道当通用推理等价。

Gemini 3.7 medium65%±3任务通过率
平均成本
$2.03
输出 token
Agent 步数

3.7 保留效率优先流程;当前原榜配置为 medium,不沿用旧 high 行。与 3.8 Token 同价不代表任务总成本相同。

GLM-5.3 Flash max63%±4任务通过率
平均成本
$0.24
输出 token
73k
Agent 步数
123

达到合格代码执行线且极便宜;比 Sol max 点估计低 10 个百分点,更适合强计划和测试兜底后的支线。

DeepSeek Pro 0813 max63%±6任务通过率
平均成本
$1.67
输出 token
106k
Agent 步数
155

已经达到可用代码专项;当前公开运行成本高于 GLM-5.3 Flash,仍可作为不同模型家族的低价代码候选。

Qwen 3.8 Max xhigh57%±3任务通过率
平均成本
见人民币价
输出 token
Agent 步数

中文、视觉与阿里生态仍有价值;长程代码不应按其 AA 综合分直接类比 Sol xhigh。

Muse 1.255%±2任务通过率
平均成本
见源
输出 token
Agent 步数

通用代码不是前沿;法律、金融和可恢复长代理才是正式收录理由。

DeepSeek Flash 0731 max53%±4任务通过率
平均成本
$0.46
输出 token
108k
Agent 步数
153

只适合计划明确、可自动验收的低风险支线;低价可能伴随更长循环。

查看 DeepSWE 原始任务、方法和当前榜单 ↗
查看 Claude、OpenAI 与 K3 16 种常见组合的完整同口径表

手机上可左右滑动;相差不到约 1 分时先按同档,再看成本、等待和自己的验收结果。

CursorBench 3.2 发布快照;费用单位为当时的平均美元 / 任务,不能直接替代 2026-08-29 的官方价格
模型与档位任务得分平均成本大白话怎么读
Fable 5.1 max73.4$9.64本表最高点位;仅比自身 xhigh 高 0.6 个百分点而费用多约 38.5%。公开页未给配置置信区间,不据小差距宣布稳定胜负。
Fable 5.1 xhigh72.8$6.96困难多文件候选;不把这条 Cursor 实测等同于 AA v4.2 的 xhigh 估算。
Grok 4.6 xhigh70.8$2.81较低平均费用的前沿候选;DeepSWE 当前为 medium 67%±2,配置与任务不混用。
Fable 5 max(旧版)70.5$17.32旧版对照;不继承给 Fable 5.1,也不再称当前点估计最高。
Opus 5 max70.0$8.23能力敏感的关键尾部;不要仅因“更放心”而常开。
Grok 4.6 high69.9$2.34只比 xhigh 低 0.9 分;适合先做日常 A/B,重要事实和长期无人值守仍需复核。
Fable 5.1 high69.4$4.80API / Code 官方默认,适合作能力优先起点;与 Sol high 63.5% 的差是 5.9 个百分点,不是智力增幅。
Opus 5 xhigh69.3$7.35困难多文件与架构;距 max 仅 0.7 分。
Gemini 3.8 Flash high69.2$2.38同版本两条代码方法支持较低成本工程候选;不继承给 Cyber 受限分支。
Fable 5.1 medium68.0$3.53日常任务可先试;邻近 Sol max 67.2%,不是跨任务等价。
Sol max67.2$5.69与 Opus high 同档;终端和测试闭环仍有独立优势。
Gemini 3.8 Flash medium67.0$1.93边界明确且验收可靠时可先试,质量不足再升 high 或回强主模型。
Opus 5 high66.7$3.91Claude 日常高质量默认;先从这里开始。
Fable 5 high(旧版)66.5$8.77旧版同任务对照,不是 5.1 的费用或分数。
Fable 5.1 low66.2$2.90在此 Cursor 任务中邻近 Sol max,但官方提示 low 可能减少检索;不能照搬到时效研究和高风险任务。
Terra max64.9$2.31按原用量乘 7 月 30 日新价;更依赖清楚边界与自动测试。
Sol xhigh64.5$3.88复杂仓库、架构、安全和终审的 OpenAI 路线。
Opus 5 medium64.3$3.29清楚、可验收的 Claude 日常任务。
Sol high63.5$2.79OpenAI 日常严肃编程默认;与 Opus low 同档。
Opus 5 low62.8$2.55低风险辅助;不要因单榜接近 Sol high 就替代严肃主线。
Opus 4.8 max62.3$5.77旧流程基线;新任务同价应先试 Opus 5。
Sonnet 5 max61.5$4.30按当前标准价,升到 max 后仍不一定比 Opus high 更省;日常更应看 medium / high。
Gemini 3.7 high61.6$1.203.7 同版本效率基线;不把这行当 3.8 成绩,也不与 DeepSWE medium 配置混合。
Luna max61.1$0.39按原用量乘 7 月 30 日新价;需要测试兜底,不能按分数替代高端主控。
K3 max60.8$2.70模糊多文件任务已可用,但没有压过 Opus / Sol 高档位;视觉和长上下文优势需看其他轨道。
Sol medium60.0$1.95相同 Cursor 框架中的日常档对照,不等于 AA 的 medium 指数。
K3 high59.7$1.89与 K3 max 只差 1.1 分;日常 Kimi Code 仍先从 high 开始。
Sol low52.6$1.01低风险明确任务参考;不能只因名称与 Fable low 相同就认定推理预算或能力相同。
Opus 5 vs Fable / Sonnet / OpenAI / Opus 4.8

能力优先先比较 Fable 5.1 与 Astra;Sol / Opus 5 保留成熟的质量成本平衡,Gemini 3.8 Flash 是较低成本工程候选。先过任务质量线,再比成功任务成本。

9/5 标准 API 每百万 Token:Fable 5.1 / Astra 普通输入输出同为 $10 / $50,但缓存读为 $0.25 / $1;Opus 5 为 $5 / $25,Sonnet 5 为常规标准价 $2 / $10,Sol 当前促销 $4 / $20(至少到 2026-11-21)。AA 的加权任务费是评测权重与实际 token/缓存用量折算的平均测评任务费,不是报价、成功任务成本或会员扣量;同单价不等于同任务账单,effort、缓存、工具、重试与人工返工必须另算。

查看结论为什么变化、哪些限制仍保留
  • AA v4.2 当前最高档:Fable 5.1 max 57(含安全回退)、Astra max 55、Opus 5 max 54、Sol max 51。旧 v4.1.1 已换方法,不与历史分数混排,也不是智力百分比。
  • Fable 5.1 的 AA low / medium / high / xhigh 分别为 48 / 50 / 52 / 54,全部标估算;Sol 与 Astra 五档无此标记。Fable 的估算档不能当完整独立实测曲线。
  • AA 五档中,Astra low 49 / $0.63 对 Sol high 48 / $0.61,Astra medium 52 / $1.16 对 Sol max 51 / $1.25;这是拿相同任务试用两者(A/B 对照)的价格起点,不是跨任务等效。旧 Fable 5 只有 max 53 / $5.62,配置含 Adaptive Reasoning、Max Effort 与 Opus 4.8 Fallback,仅供已有用户对照,新项目不据此优先选旧版。
  • CursorBench 3.2 中 Fable 5.1 low / medium 为 66.2% / 68.0%,跨过 Sol max 67.2%;但其 max 73.4% 与 xhigh 72.8% 仅差 0.6 个百分点,平均费用多约 38.5%。Astra 暂无该榜成绩。
  • DeepSWE 9/3:Astra xhigh 74%±3 / $6.52,Sol max 73%±3 / $6.46,Gemini 3.8 high 74%±1 / $2.36。区间重叠,支持同领先档而非唯一冠军;Fable 5.1 不在当前原榜。
  • Vals Index v2 当前为 Fable 5.1 max 68.83%±1.08(含回退)、Astra max 66.61%±1.09、Sol max 63.71%±1.06。它偏金融、编程与法律,不是整体经济自动化比例;Sol 页面费用仍按旧价,不能当当前促销账单。
  • 单项方向会反转:Vals Terminal 2.1 为 Astra 87.27%、Sol 85.77%、Fable 5.1 85.02%(含回退);AA GDP.pdf 全标准通过为 33.2% / 28.2% / 26.2%。综合领先不等于每项都领先。
  • Gemini 3.8 Flash 在 Cursor 为 high 69.2% / $2.38、medium 67.0% / $1.93,结合 DeepSWE 支持工程候选。它与 3.7 Token 同价,却可能消耗更多 Token;3.7 保留效率优先入口。
  • GLM-5.3 的 AA v4.2 max 49 与 DeepSWE 69%±3 支持开放权重前沿;Flash 的 AA 46 与 DeepSWE max 63%±4 / $0.24 支持低价执行,但不是与 Sol 某档全面等价。
  • Grok 4.6 在 Cursor xhigh 70.8% / $2.81、high 69.9% / $2.34;DeepSWE 当前是 medium 67%±2 / $3.45。不同评测的 effort 不能交叉替换。
  • Fable 5.1 在 CodeRabbit 的两种配置没有升档普遍收益;Sol 对照来自不同 pipeline,不能直接判胜负。代码审查仍需实现者自测、独立反证和真实失败证据。
  • Muse Spark 1.3 与 Qwen3.8-Flash-Next 已有同版本 AA 信号,但第二种广泛工程方法或可用性仍有缺口。不能继承 Muse 1.2 专业任务,也不为新名字自动增设正式路由。
opusplan

官方别名:Opus 负责计划,Sonnet 负责执行。适合计划需要更强判断、而实现边界已经稳定的任务。

ultracode

Claude Code 的动态工作流编排,当前建立在 xhigh 上;它不是 API 的第六个 effort,也不要和 OpenAI Ultra 混同。

Subagents

每个助手有独立上下文,可指定更便宜模型与 effort。适合读大量日志、测试、文档,不必把噪声塞回主线程。

Agent teams

只适合独立研究、模块或竞争假设。总 token 明显更高;顺序任务和同文件修改不要开团队。

Codex × Claude × GLM / K3

跨模型配合:角色互补,不是互相重复回答

两家额度都充足时,没有固定的“Claude 永远计划、Codex 永远实现”。按任务选角色,再用另一家做真正独立的审查。
跨模型计划、执行与审查建议
任务形状计划执行审查
需求模糊、需要先把问题讲清Astra high / xhigh 或 Fable 5.1 high / xhigh;成熟流程可保留 Sol / Opus 5计划稳定后交给 Sol high 或 Gemini 3.8 high;成本敏感、测试强且可回滚时可试 GLM-5.3 Flash max换另一家模型只读审查,优先找遗漏和可复现错误
边界清楚的日常功能主执行模型自己做短计划即可Sol high;预算型流程试 Terra xhigh / max、GLM-5.3 Flash max 或 Sonnet 5 high机器测试先行;高风险部分再用不同模型审查
架构、安全、复杂迁移Astra / Fable 5.1 xhigh;失败代价高且有独立验收时可直接 max,不强制逐档重跑按模块拆分;边界稳定部分降到 Sol high / Sonnet 5未参与实现的强模型 + 全量测试 + 人工批准
反方论证、缺口与证据审计主模型先写当前结论和证据标准Luna high / Sonnet 5 / Haiku / GLM-5.3 Flash 做便宜的反例搜索强模型判断反例是否成立;廉价代理不能直接推翻结论
01

一个人做高质量功能

中等预算
  1. Astra medium / high 或 Fable 5.1 high 先写验收、风险和分阶段计划;预算平衡可用 Sol / Opus。目标不确定时先解决不确定性,不把模糊计划直接交给低价执行者。
  2. 原强主模型可以继续实现;质量达标后再按成本选 Sol、Opus 或 Gemini 3.8 Flash,并运行测试。真正明确、可回滚的子任务再试更便宜模型,需要多写入者才分配独立工作区。
  3. 实现者自测通过后,让另一家模型做一次独立只读复核;有可复现问题就修复重验,没有新增证据不反复争论风格。

停止规则:理解错核心语义时回到强模型;验收已满足且复核不再提供新失败证据时停止。

02

成本优先的日常开发

低—中预算
  1. 先由 Astra / Fable 5.1 / Sol / Opus / GLM-5.3 中适合任务的强模型写清目标、必要边界、验收与失败退路。
  2. 质量达标后,小流量试 Gemini 3.8 Flash、GLM-5.3 Flash max、Luna 或 DeepSeek Pro max;用相同代表任务比较成功率、实际费用、等待和返工。
  3. 测试、类型检查与构建按改动风险执行。漏步骤可修流程;认真尝试后仍理解错就回强模型,不无限重跑。能直接完成的简单任务不强制套多模型链。

停止规则:重复失败或返工成本超过节省的模型费用时停止低价重试并升级。

03

复杂研究与方案决策

质量优先
  1. 先确定要回答的决策与原始证据。资料整理可交明确子任务;X 一手帖子可用 Grok 工具检索,但不把实时性当准确性。
  2. Astra / Fable 5.1 按资料类型和真实可用工具综合;Sol / Opus 为预算或工具兼容候选。每条重要结论保留来源、日期、推断和未确认项。
  3. 只在反证能带来净收益时安排独立复核;支线不独立就留在单主线,不默认并行或 Ultra。

停止规则:无法新增原始证据时,不靠多开代理制造确定性;保留明确未知。

04

确有独立模块时并行

按净收益决定
  1. 强主模型先明确接口、写入责任和验收;不把所有文件限制写死,必要范围变化由负责人协调。
  2. 独立写入任务用隔离工作区;同一共享文件一个责任人。让代理具备完成授权任务所需工具,不用过窄权限制造无效交接。
  3. 主线程合并、运行相称的集成测试,再由未参与实现者复核。模型、effort 与代理数量分别调整,不能把 max 分数当 Ultra 成绩。

停止规则:模块依赖反复变化、共享写入过多或协调成本超过收益时,退回单主线。

独立工作区评测

“每 token 更贵”不一定等于“每项任务更贵”

历史 VIKTOR 公司任务中,Sol 与旧 Fable 5 调整后都为 76%,总成本约 $33.55 对 $96.35;单次运行误差约 2—3 个任务。这不是 Fable 5.1 的结果,也不能外推成所有公司都相同。

查看评测方法与完整结果 ↗
大规模迁移案例

强模型定规则与审查,小模型并行执行

Anthropic 公布的百万行 Bun 迁移先建立规则手册,再由 12 个 Sonnet worker 扇出执行、较强模型复核;合并前测试全绿仍出现 19 个回归,说明自动测试与人工审查都不能省。

查看完整迁移复盘 ↗
Kimi K3 的位置

作为专项补位,不默认塞进每条编程流水线

K3 更适合超长资料、多模态输入、Kimi 生态或并行研究命中明确优势时加入;普通代码主线先把 Codex / Claude 的验收流程跑稳。

查看 K3 普通、集群与 1M 上下文指南 →

把模型接进网站或企业流程

先设质量底线,再算一次成功任务的总成本

效果优先和成本优先是两套合法策略:核心决策先买正确性;非核心、高频、可校验任务达到底线后再压成本。
成功任务成本

模型调用费 + 缓存与长上下文 + 重试 + 工具调用 + 人工返工 + 等待损失 ÷ 最终成功任务数

挂牌“每百万 token”只是第一项。便宜模型如果重试更多、输出更长或需要人工修,可能反而更贵。

客服分类、标签、格式化

最低质量线
错了可重试,结果可规则校验
建议路线
GLM-5.3 Flash / Luna / Haiku 等低价模型
为什么
达到可用线后,吞吐和单次成本更重要。

检索摘要、会议纪要、内部知识问答

最低质量线
必须附原文与来源;关键数字可复查
建议路线
GLM-5.3 Flash / Luna high / Sonnet 5,关键结论升级主模型
为什么
把便宜模型用于压缩材料,把风险判断留给强模型。

用户可见写作、代码建议、普通 Agent

最低质量线
稳定达到品牌、正确性和工具调用要求
建议路线
Sol high / Sonnet 5 high;测试强可评估 Terra
为什么
这里要平衡一次成功率、延迟、返工和模型账单。

付款、安全、合规、核心经营决策

最低质量线
错误损失高,且有人工批准与审计记录
建议路线
Astra / Fable 5.1 xhigh 或 max;不同厂商独立核验,保留人工决策与授权门
为什么
先买正确性,再谈价格;单价不是主要成本。

上线前用自己最常见、最昂贵和最危险的任务分别建样本;不要只测平均题,也不要把公开榜单的通过率直接当企业 SLA。

最后由自己的任务拍板

用 15—30 个真实任务建立你的成本—质量曲线

统一提示、工具、仓库状态和验收方法;不要拿一次惊艳演示代替稳定性。
  1. 分层抽样:机械小改、日常多文件、复杂调试、架构/安全、长研究各取 3—6 个。
  2. 冻结环境:同一提交、同一工具权限、同一超时、同一验收测试。
  3. 先跑起点:Sol high、Terra xhigh、Luna high;旧流程加 GPT-5.5 high / xhigh 对照。
  4. 按失败原因升级:漏步骤升 effort,能力理解错误升模型,可并行才开多代理。
  5. 计算成功任务成本:模型费用 + 重试 + 人工返工 + 等待损失,而不是只看挂牌价。

至少记录这 5 项

  • 一次是否正确完成,而不是“看起来不错”
  • 总等待时间与人工盯守时间
  • 模型费用、重试费用与订阅额度消耗
  • 人工修改行数、返工轮数和回归数量
  • 是否主动读取关键文件、运行测试并报告限制

每档差 1 分、差一两题或置信区间重叠时按同档;再由等待时间、预算和人工返工决定。

最后再总结一次

模型不是越强越好,工作流也不是越复杂越好

  1. 日常编程:Sol high 是省心默认;简单且验收清楚可降 medium。
  2. 预算工程:Terra 只有在你的固定任务和测试体系里证明成功成本更低,才值得替代。
  3. 关键尾部:架构、安全、迁移与终审用 xhigh;失败代价高可直接 Max。
  4. 低价助手:Luna medium / high 负责抽取和整理;计划冻结、测试可验收时再让 xhigh / max 执行批量改动,强模型负责冲突与批准。
  5. 多模型协作:先分计划、执行、审查,再决定线程、子代理、worktree 或团队。

来源、日期与限制

每种证据只回答它能回答的问题

官方来源确认型号、价格、可用入口与机制;独立测试比较任务表现;公司案例和社区经验只提供工作流线索。
资料核验:2026-09-05Radar 抓取:2026-07-23 17:45(UTC+8)Radar 基线:2026-07-23 17:45(UTC+8)价格口径:2026-09-05(Astra / Fable 5.1 标准价;Sol 与 Gemini 介绍价;Sonnet 5 常规标准价;历史评测账单另标)Artificial Analysis Intelligence Index v4.2(9/4 换版;不与旧值混排)
当前 AA 方法Artificial Analysis:9 月 4 日切换 v4.2,不与旧指数混排打开原始来源 ↗当前 AA 各档Artificial Analysis:Fable 5.1 五档,低于 max 的四档标估算打开原始来源 ↗当前 AA 各档Artificial Analysis:Astra 各推理档与加权任务费用打开原始来源 ↗当前 AA 对照Artificial Analysis:Sol 各推理档与加权任务费用打开原始来源 ↗官方 AstraOpenAI:Astra 模型规格、推理档与接口支持打开原始来源 ↗官方 Fable 5.1Anthropic:Fable 5.1 型号、入口与默认档打开原始来源 ↗官方 Claude 当前价格Anthropic:Fable 5.1 缓存读与 Sonnet 5 标准价打开原始来源 ↗官方 Gemini 3.8Google:Gemini 3.8 Flash 与受限 Cyber 分支打开原始来源 ↗独立 Fable 5.1 审查CodeRabbit:45 个审查任务与升档边际收益打开原始来源 ↗官方 GLM-5.3Z.AI:GLM-5.3 发布、规格与 API 价格打开原始来源 ↗官方 GLM-5.3 FlashZ.AI:GLM-5.3-Flash、Ox Alpha 与 max 使用边界打开原始来源 ↗独立 GLM 对比Artificial Analysis:GLM-5.3 与 Flash 综合、速度和任务成本打开原始来源 ↗官方 Qwen 观察项Qwen:Qwen3.8-Flash-Next 官方权重模型卡与生产服务区别打开原始来源 ↗官方 Gemini 3.7Google:Gemini 3.7 Flash 模型卡与 API 价格打开原始来源 ↗官方 DeepSeek 0813DeepSeek:V4 Pro / Flash 型号、峰谷价格与更新记录打开原始来源 ↗官方 Grok 产品xAI:SuperGrok 套餐、共享周额度与 Grok Bot打开原始来源 ↗官方 Grok 规格xAI:Grok 4.6 发布、上下文、推理档与价格打开原始来源 ↗独立专业任务Vals:Grok 4.6 high 的金融与编程加权任务打开原始来源 ↗官方规格与接口OpenAI:Sol 当前促销价、长上下文价格与规格打开原始来源 ↗官方使用建议OpenAI:当前主力模型、推理档与迁移指南打开原始来源 ↗官方计费OpenAI:Codex credits 费率表打开原始来源 ↗官方价格更新OpenAI:Terra 降价 20%、Luna 降价 80% 与新工作流建议打开原始来源 ↗官方语音入口OpenAI:ChatGPT Work 与 Codex 的实时语音操控打开原始来源 ↗官方工作流OpenAI:子代理、长任务、Git worktree 与自动化打开原始来源 ↗官方工作区隔离OpenAI:Git worktree 的并行任务与文件隔离打开原始来源 ↗独立综合评测Artificial Analysis Intelligence Index 当前入口(旧表另标历史日期)打开原始来源 ↗历史真实仓库来源Distributed Codex Radar:本站保留 7 月 23 日固定快照打开原始来源 ↗开源方法SecurityMind/dradar:分布式运行与独立复判方法打开原始来源 ↗独立工程评测CodeRabbit:Sol、Terra 在长任务与代码审查中的差异打开原始来源 ↗独立代理评测VIKTOR:GPT-5.6 与 Claude 的真实工作区任务打开原始来源 ↗独立 5.5 实测Stet:GPT-5.5 high 与 xhigh 的真实 Go 仓库曲线打开原始来源 ↗社区单一样本r/codex:大型 TypeScript monorepo 的 Sol / Terra / Luna 使用记录打开原始来源 ↗社区混合信号r/codex:GPT-5.6 发布讨论、速度、范围膨胀与稳定性反馈打开原始来源 ↗官方 Claude 规格Anthropic:Claude 模型、上下文与 API 价格打开原始来源 ↗官方 Opus 5Anthropic:Opus 5 发布、定位与产品入口打开原始来源 ↗官方 Opus 5 迁移Anthropic:Opus 5 行为、effort 与提示词变化打开原始来源 ↗官方 Claude CodeAnthropic:Claude Code 模型别名、effort 与 opusplan打开原始来源 ↗官方语音输入Anthropic:Claude Code /voice 语音听写与使用限制打开原始来源 ↗官方语音对话Anthropic:普通 Claude 的双向 Voice mode打开原始来源 ↗官方实践解释Anthropic:如何区分“换模型”与“提高 effort”打开原始来源 ↗官方多代理Anthropic:Agent teams 的适用任务与协作边界打开原始来源 ↗官方子代理Anthropic:主对话、子代理与上下文隔离怎么选打开原始来源 ↗官方成本Anthropic:Claude Code 与 Agent teams 成本管理打开原始来源 ↗独立工程方法Simon Willison:用子代理保护主上下文,而不是过度拆角色打开原始来源 ↗独立规格方法Addy Osmani:把边界、测试和自检写进 Agent 任务规格打开原始来源 ↗独立 Claude 企业任务FullStack:Sonnet 5 与 Opus 4.8 的企业工程任务对比打开原始来源 ↗独立 Claude 推理档Stet:Sonnet 5 与 Opus 4.8 的 effort 成本曲线打开原始来源 ↗独立 Claude 审查CodeRabbit:Sonnet 5 代码审查的精度、召回与 Max 成本打开原始来源 ↗独立 Opus 5 综合Vals Index v2:Fable 5.1、Astra、Sol 等专业任务比较打开原始来源 ↗独立多文件成本CursorBench 3.2:Fable 5.1 与 Sol 全档及 Gemini 3.8 的同任务费用打开原始来源 ↗独立长程编程DeepSWE v1.1:113 个原创长程工程任务打开原始来源 ↗厂商发布时内部评测Anthropic:Frontier-Bench v0.1 运行口径、5 次尝试与拒答回退打开原始来源 ↗独立 Opus 5 审查CodeRabbit:Opus 5 构建、精度、召回与琐碎意见打开原始来源 ↗
仍需保留的限制

Radar 是滚动社区样本,运行环境、配额与模型服务会变化;AA 总成本是整套评测成本;厂商发布页中的自报榜单只作为厂商证据。本文没有把不同 harness、不同日期或不同代理框架的数字硬平均。