Fable 5.1 max
AA 57 · 含回退当前综合指数领先;AA 加权任务费 $6.12,约为 Astra max 的 2.38 倍。价格更高不代表每个项目收益更大。
看 Fable 的证据与限制 →模型 × 推理档 × 工作流
先说结论:质量优先的新任务把 Astra 与 Fable 5.1 放入主力候选;成熟日常工作仍可用 Sol。先由强模型把需求和验收写清,再让 Gemini 3.8、Terra 或 Luna 执行适合的支线。Max 处理高价值难题,Ultra 只处理真正能并行的任务。
当前前沿 · 2026-09-05 核验
综合能力优先,Fable 5.1 与 Astra 都值得进入主力候选;不是任何任务都要换掉 Sol。Fable 的综合点估计领先,Astra 在终端与长文档任务中更突出;成熟日常工作仍应比较实际账单、等待和返工。
当前综合指数领先;AA 加权任务费 $6.12,约为 Astra max 的 2.38 倍。价格更高不代表每个项目收益更大。
看 Fable 的证据与限制 →综合点估计低 2 分,但终端与 PDF 阅读单项领先。2 分不是“智力低 2%”;不能用总分代替任务选择。
看 Astra 的能力与成本 →Sol 的成熟工作流无需一键推倒。Gemini 3.8 在两种独立代码评测中表现强,可试作有验收的执行者,不等于通用能力第一。
看 Gemini 3.8 的适用任务 →综合推理看 AA:Astra low 约在 Sol high 与 xhigh 之间,medium 已到 Sol max 附近。实际 Cursor 编程看另一张表:Fable 5.1 low—medium 已接近 Sol max。两者并不矛盾,因为不是同一套任务,也不是同一种代理工具。
能力接近时的费用对照
先说结论:按 AA v4.2 的综合题结果,Astra low 与 Sol high 几乎同费;Astra medium 比 Sol max 低约 7.2%。这给出拿相同任务试用两者(A/B 对照)的起点,不是保证每种工作都一样好。
这里的美元是 AA 平均加权测评任务费,不是一次项目报价、成功任务成本或会员扣量。原始数据:Astra AA 页面 ↗ · Sol AA 页面 ↗
低档对日常高档
按 Sol high 的价格作比较,Astra low 比它贵 3.3%。
若与 Sol xhigh(50 分 / $0.89)比较,Astra low 便宜 29.2%。
如果只按 AA v4.2 的综合题与加权任务费,先拿相同任务试用两者(A/B 对照);Astra low 与 Sol high 是几乎同费的相邻数字,相比 Sol xhigh,Astra low 也更省。但这不是保证每种工作都一样好。
中档对旗舰高档
按 Sol max 的价格作比较,Astra medium 比它低 7.2%。
Astra medium 在 AA 综合题比 Sol max 高 1 分、加权任务费低一些,适合在有明确验收的相同任务上试用;若任务质量、账单或耗时不合适,保留成熟流程,不因这 1 分就切换。
只据 AA 时可优先试 Astra low 替代 Sol high、Astra medium 替代 Sol max;成熟工作流不必因为 1 分就切换。按实际任务质量、账单、耗时和返工验收,再决定是否改变主力。
| 推理档 | Fable 5.1 | 旧 Fable 5 历史参照 | Astra | Sol |
|---|---|---|---|---|
| low | 48(估算) / — | —(缺测) | 49 / $0.63 | 41 / $0.23 |
| medium | 50(估算) / — | —(缺测) | 52 / $1.16 | 46 / $0.37 |
| high | 52(估算) / — | —(缺测) | 53 / $1.41 | 48 / $0.61 |
| xhigh | 54(估算) / — | —(缺测) | 54 / $1.85 | 50 / $0.89 |
| max | 57 / $6.12 | 53 / $5.62 | 55 / $2.57 | 51 / $1.25 |
Fable 5.1 的 low、medium、high、xhigh 都被 AA 标为估算,不能当作完整实测曲线。Fable 5.1 各档配置允许回退至 Opus,不能当作绝不切模型的纯单模型成绩。旧 Fable 5 只有 max 有公开数字:53 分、$5.62;配置是 Adaptive Reasoning / Max Effort / Opus 4.8 Fallback,其余四档缺测。旧版仅供已有用户对照,新项目不据此优先选旧版,也不能替 Fable 5.1 的估算档补值。Astra 与 Sol 五档未标估算。不同模型拿到相近指数,只能说在这套综合题附近,不能保证写代码、研究和沟通都相当。
原始结果:Fable 5.1 全档 · Astra 全档 · Sol 全档 · 旧 Fable 5 资料页 · 旧 Fable 5 AA 原页 · 方法变更
在 CursorBench 3.2 里,Fable medium 的 68.0% 与 Sol max 的 67.2% 相近。这不是“任何场景都等效”。该榜来自 Cursor 中含糊、多文件的真实任务,未公开配置级样本量和误差区间,不能凭小差距宣布必胜。当前没有 Astra 行,不能替它补分。
| 推理档 | Fable 5.1 | Sol |
|---|---|---|
| low | 66.2% / $2.90 | 52.6% / $1.01 |
| medium | 68.0% / $3.53 | 60.0% / $1.95 |
| high | 69.4% / $4.80 | 63.5% / $2.79 |
| xhigh | 72.8% / $6.96 | 64.5% / $3.88 |
| max | 73.4% / $9.64 | 67.2% / $5.69 |
Fable xhigh → max:得分只增加 0.6 个百分点,平均费用却增加约 38.5%。不能确认这个小增益显著;一般先 high,需要深查用 xhigh,失败代价很高才考虑直接 max。这个建议是基于证据的使用策略,不是承诺。
对比最高档:73.4% 对 67.2%,相差 6.2 个百分点,而每任务账单约多 69%。原榜没有公开“整项任务全对才得分”的二元定义,因此不能解释成每 100 次多完成 6 次,也不能换算失败减少百分比。可理解为:这套多文件编程题的平均表现更高,是否能少返工仍要在自己的项目里验证。
目前支持 Astra 属于前沿执行档,不支持“所有编程任务全面超过 Sol”。DeepSWE 用同一个 mini-swe-agent、同样的提示与命令行工具处理 91 个仓库的 113 项任务;模型需要读文件、改代码并通过测试。
| 实际测试配置 | 通过率 | 美元 / 任务 |
|---|---|---|
| Astra xhigh | 74% ±3% | $6.52 |
| Sol max | 73% ±3% | $6.46 |
| Opus 5 max | 74% ±4% | $11.84 |
| Gemini 3.8 Flash high | 74% ±1% | $2.36 |
区间明显重叠,按同一领先档看。Astra 的输出约 30K token、29 步,Sol 约 60K、61 步,但账单几乎一样;Gemini 约 143K、166 步,便宜的单价不等于步骤更少或速度更快。这里尚无 Fable 5.1;旧 Fable 5 的成绩不能继承。
Vals Terminal 2.1 的另一套终端任务:Astra max 87.27% ±0.38、Sol max 85.77% ±1.35、Fable 5.1 max 85.02% ±0.99(含回退)。± 是标准误 SEM,不是 95% 置信区间;这里不据此宣布显著胜负。而 Vals v2 综合指数是 Fable 68.83、Astra 66.61、Sol 63.71;综合指数不是整体任务完成率。AA 的真实 PDF 全标准通过率又是 Astra 33.2%、Sol 28.2%、Fable 26.2%。这正说明“最高总分”不能代替“我这项工作”。
AA 费用的白话:它按评测权重、实际输入/缓存、推理和回答 token 折算成平均测评任务费;不是一次网站修改报价,不是成功任务成本,更不是 Codex 会员扣量。Fable 5.1 max $6.12 对 Astra max $2.57 约 2.38 倍,只是 AA 这套评测的口径,不能泛化成每个项目的账单。
标准短上下文 API 价(美元/百万 token):Astra 输入/缓存读/输出为 $10/$1/$50,Sol 为 $4/$0.40/$20。Astra 每 token 约 2.5 倍,但如果少用 token、少重试,差距可能被抵消;大量输入重读时仍可能更贵。Sol 当前促销至少到 2026-11-21,长期预算应另看促销结束、长上下文和缓存写入。
| 模型 | 输入 | 缓存命中 | 输出 |
|---|---|---|---|
| Fable 5.1 | $10 | $0.25 | $50 |
| GPT-6 Astra | $10 | $1 | $50 |
| GPT-5.6 Sol | $4 | $0.4 | $20 |
| Claude Opus 5 | $5 | $0.5 | $25 |
| Claude Sonnet 5 | $2 | $0.2 | $10 |
| Gemini 3.8 Flash | $0.75 | $0.075 | $3.75 |
| GPT-5.6 Terra | $2 | $0.2 | $12 |
| GPT-5.6 Luna | $0.2 | $0.02 | $1.2 |
Fable 5.1 缓存命中降到 $0.25。Anthropic 与 OpenAI 另有缓存写入价,Google 另有缓存存储费,工具使用也可能另计。Astra 超过 272K 输入后整次请求采用 $20 / $75 的长上下文档;Sol 对应 $8 / $30、Terra $4 / $18、Luna $0.40 / $1.80。Gemini 3.8 介绍价到 12 月 31 日,2027 年输入 / 输出为 $1.50 / $7.50。Sonnet 5 原计划涨价已取消,$2 / $10 是当前标准价。
速度只支持这次 AA API 测量:Astra low 为 85.7 token/s、首 token 6.64s;Sol high 为 71.9 token/s、首 token 18.83s。它只说明这次测量 Astra 更快,不能承诺整个工程按比例加速;工具等待、输入重读、失败和返工仍要实测。Astra low 原页 · Sol high 原页
网页视觉与浏览器游戏首稿,先试 Fable 5.1;完整游戏工程和 3D 美术,目前不能宣布它一定胜过 Astra。这是有边界的试用顺序,不是把两者永久分成“美术”和“程序员”。
| 你要做的东西 | 建议先试 | 为什么,不能推出什么 |
|---|---|---|
| 网站页面、React 界面、照参考图还原 | Fable 5.1 high;精细修改再试 xhigh | Arena 的 Fable max 版本有强网页偏好证据,但不能反推 high 同样第一;Astra 尚未在该榜出现。 |
| 浏览器小游戏、Canvas 互动作品 | Fable 做第一版,Astra 独立检查或做另一版 | Gaming 分榜支持“生成后更受喜欢”,不等于碰撞、胜负、重开、触控和性能全部可靠。 |
| SVG 图形、shader 特效、程序化 3D 场景 | 同一个小场景让两者试做,选更贴近风格的继续 | 有直接演示与可读源码,但缺同预算重复盲测;画面常受 Blender、贴图模型与渲染器影响。 |
| Unity / Unreal / Godot 的完整游戏 | 先按引擎、现有仓库和最小玩法实测,不指定冠军 | 尚无充分同条件对照。状态、物理、存档、资源管理与目标设备表现,不能由网页美感分代替。 |
Arena 9 月 4 日:Fable 5.1 max 在 WebDev 总榜为 1763 ±16(2,227 票),Gaming 为 1903 ±37(636 票),React 为 1811 ±20(1,620 票),参考设计为 1819 ±43(356 票),合理名次均为第一。它们是同一平台的一种人类偏好方法,不是四家独立测试;Astra 缺席不等于落败,也不能把 Elo 分数当百分比。
换成检查应用功能的 Vals Vibe Code v1.1:Fable 5.1 max 90.26% ±1.57(含回退),Astra max 89.59% ±2.17。仅差 0.67 个百分点,± 为标准误,不足以给出稳定胜负;该得分不是零返工项目比例,也不是专门的美术评审。
PhiloLabs 公开了两者按同一 brief 制作 Three.js 场景的源码和并排走镜。Fable 一侧包含多阶段、多代理和反复修复,不是“一句话就完美”;其项目自测也记录了某视角约 32 fps 和未完成行为。Astra 也使用 Blender 资产,双方 effort、完整预算、重复次数和对称性能测试未充分公开。这是值得看和试跑的单项目样本,不是本站复现实验或游戏美术冠军证据。
这些是依据任务证据与官方工具方法给出的可验证策略,不是已经证明的万能组合。程序图形与真正的角色原画、贴图、视频素材不同;需要素材时应另选图像/视频工具,不把生成模型的贡献都记到语言模型头上。
先按任务做决定
Astra medium 的 AA v4.2 已略高于 Sol max;Fable 5.1 在 Cursor 多文件任务更强。强模型已经理解复杂工作且能通过验收时可以继续实现;按自己的质量、账单、耗时和返工复测,关键尾部再升 xhigh / max,不把单榜接近当全面等效。
只据 AA v4.2 可把这两组当拿相同任务试用两者(A/B 对照)的价格起点;成熟工作流不因 1 分全部切换。限制不必要的高 effort,不等于禁用旗舰;高风险或认真尝试仍失败时升级,并用真实账单、耗时和返工决定是否切换。
这是质量与成本平衡的起点;简单任务降 medium,核心语义仍做不对时升 Astra / Fable 5.1,不只反复堆 Sol effort。
Gemini 3.8 在两条独立代码方法兼具较强能力和较低平均费用;Token、步骤与返工仍需实测。Terra 的 Radar 优势来自 7 月历史快照。
要求它返回原文、路径与未确认项;计划已冻结且测试可靠时可试 xhigh / max 执行,复杂综合仍交给主模型。
强模型先写计划和验收,低价模型执行明确、可回滚工作;认真尝试仍理解错就回到 Astra / Fable 5.1 / Sol / Opus。按实际可用工具与成功任务成本选,不永久限定模型职业。
预算受限可保留 Sol xhigh。若一次失败的返工已比升档更贵,可直接 max;不必机械逐级试。测试与独立复核仍不可省。
每条有独立产物和验收时再开 Ultra / Agent team;共享同一文件就串行。
优先比较 Sol high、Terra max;语义等价和审查质量不要只看测试绿不绿。
先把名词分开
决定能力上限。Sol、Terra、Luna 是三颗不同的“大脑”,不是同一模型的快慢档。
模型权重与能力层级不同;换模型会改变每 token 单价、知识与推理上限。决定这颗大脑愿意花多少步骤读文件、试方法、用工具和复查。
它会改变推理、工具调用、验证与输出 token,因而改变整项任务成本。一个模型自己把难题想得更久、更深。
GPT-5.6 的最高单代理 effort;GPT-5.5 不支持 Max。一个负责人同时安排多名助手并行,不是简单的“Max 再加一级”。
OpenAI 默认协调 4 个代理;总成本包含所有代理 token,只有任务可并行时才可能更快。Pro 是另一种高质量服务模式,Fast 是加速;都不能和 effort 混为一谈。
Pro mode 独立于所选模型/effort;Codex Fast 提高速度与 credits 消耗,不会换模型权重。先把最容易误解的话讲明白
把语音需求聊清楚会明显提高 Sol medium、Terra 等预算档的成功率,但不会把它们“聊成”更强模型。任务越模糊、隐含取舍越多,越值得先让强模型整理成计划;任务越简单、测试越硬,预算模型越有机会发挥价格优势。
把结果说成一句可以检查的话,例如“在套餐页新增按用途筛选,并保留原价格数据”。
交付物、目标路由、输入输出与成功状态。列出文件、页面和不能碰的内容;不要只说“把网站优化一下”。
作用域、非目标、权限边界、兼容约束。写出能直接执行的检查:哪条命令要绿、哪个页面在手机上不能溢出、哪段文字必须出现。
验收测试、视觉视口、期望输出与回归门。遇到数据冲突、会覆盖已有改动或需要新权限时先报告,不自己猜。
停止条件、升级条件与失败恢复。先看你要的是实时指挥代理、把口述变成提示词,还是普通语音聊天。入口相似,不代表工作方式相同。
ChatGPT 桌面端的 Voice 可以进入 Work 或 Codex,沿用当前工具和权限启动、协调任务。它是语音交互入口,不应写成 Codex 单独换了一个“语音模型”。
目前面向符合条件的 macOS / Windows 桌面账号逐步开放;一次只能进行一场语音对话,Codex 也不能在网页或手机端直接新建。OpenAI 官方说明 ↗语音会实时转成输入框里的文字,可与键盘混合编辑,再作为普通提示词发送;当前官方文档没有把它描述成持续用语音回答的双向编程通话。
音频会发送到 Anthropic 服务器转写,不消耗 Claude 消息或 token;需要 Claude.ai 登录和本地麦克风,不适用于 API Key、SSH、网页远程环境。Claude Code 官方文档 ↗Claude 网页和移动端的 Voice mode 支持用户说话、Claude 语音回答和中途打断,但它与 Claude Code 的代码工作区、终端工具和语音听写是不同产品层。
不要把普通 Claude 的双向语音能力写成 Claude Code 已经具备同样的语音代理控制。Claude Voice 官方说明 ↗一句话选择:想边说边让编程代理开工、打断和协调,选 ChatGPT 桌面端的 Codex Voice;想口述一段可检查的代码需求,选 Claude Code /voice;想正常语音聊天,选普通 Claude Voice。
同口径数据
当前查看
读文件、定位范围、低风险小改;不要把它当复杂仓库默认档。
目标、文件边界和验收测试都写清楚时可做日常工程;模糊需求仍可能受规划上限影响。
多文件实现、需要主动查漏和核验的主力档;当前促销后仍是最省心的通用起点。
架构、安全、复杂迁移、语义等价和终审;不要只为“更放心”长期常开。
最难且高价值的尾部任务。若一次失败的时间或损失已高于升档成本,可以直接跳到 Max,不必机械逐级试。
只给可并行的研究、竞争假设、审计或独立模块;同一条串行代码链通常不划算。
模型卡顶部是 API 每百万 token 挂牌价。AA v4.1.1 是历史题集,不能与本页上方的 v4.2 相减;“整套评测成本”也不是上方的加权单任务费。Radar 保留 7 月 23 日固定用量,Terra / Luna 按 7 月 30 日价机械折算,Sol 账单早于当前促销,不能理解为重新跑过或今天的发票。Ultra 没有 AA 同口径分数,明确留空。
自选 1—6 个档位
这是历史工作流对照:AA v4.1.1 与 7 月 23 日 Radar 固定快照,不与上方 v4.2 相减。条形图一次只比较一个指标,旧账单不当今天的发票。
Terra Max 比 Luna High 该快照大约多完成 24 个。
Luna High 比 Sol High 该快照平均少约 $4.74。
Sol Medium 比 Terra Max 该快照平均少等约 15.0 分钟。
“100 个任务”只是把百分点改写成容易理解的单位,不是预测你的下一次任务;任务、工具、提示和测试改变后,差距可能缩小、放大或反转,也不能换算成人类智商。
已选 5/6 个;至少保留 1 个。达到上限后,先取消一个再添加。
| 模型与档位 | AA 分 | AA 整套成本 | Radar 通过率 | Radar 历史估价 | Radar 历史耗时 |
|---|---|---|---|---|---|
| GPT-5.6 Sol · Medium | 56 | $429 | 60.7% | $3.36 | 13.8 分 |
| GPT-5.6 Sol · High | 57 | $700 | 62.7% | $4.95 | 19.1 分 |
| GPT-5.6 Terra · xhigh / Extra High | 52 | $728 | 56.7% | $1.85 | 16.4 分 |
| GPT-5.6 Terra · Max | 55 | $1,648 | 67.0% | $3.62 | 28.8 分 |
| GPT-5.6 Luna · High | 46 | $55 | 43.3% | $0.21 | 15.7 分 |
像“多科综合考试”:旧交互表保留 v4.1.1 固定快照;页首前沿对照与首页总榜使用 v4.2。新旧题集不能相减,估算不能当实测,整套成本也不是普通用户一次任务的价格。
像“固定仓库上机考试”:每个模型 × 推理档 × 任务格保留近期最多 3 次有效判分;页面通过率按所有 p / n 汇总。这里的通过率、耗时和单题账单都冻结在 7 月 23 日,用于解释任务差异;Sol 当前促销与后续价格变化必须用自己的 token 日志另算。
综合能力更高,不保证在固定工具链里通过更多;反过来也一样。约 1 分、少量任务或样本重叠时按同档,再看自己的任务。
把数字翻译成决定
优先省心选 Sol medium;需求和验收都很清楚、能接受略低成功率时,Terra xhigh 在 7 月 23 日固定仓库快照中的单题账单约低 45%。Sol 8 月促销会缩小价差,最终应按自己的 token 结构重算。
换成体感:按固定 Radar 快照,100 个同类仓库任务里 Sol medium 大约多完成 4 个;旧账单中 Terra xhigh 每题少约 $1.51、但多等约 2.6 分钟。这个账单早于 Sol 当前促销,不能直接当今天的发票。
更偏左边:语音需求还比较散、模型需要自己补全范围,或你不想花时间盯执行过程。
更偏右边:文件范围、禁止事项、输入输出和验收命令都已写清,失败会被测试可靠拦住。
两者只是两个可用起点,不是能力等价。AA 与 Radar 都把 Sol medium 放在前面。
Terra 的优势是单题账单,不是更快:当时降价后价差扩大,但平均等待仍约多 19%。
如果让更强模型先写清计划和验收,再交给 Terra 执行,通常能减少需求歧义;但不会消除 Terra 自身的推理上限。
模糊、多变、需要主动判断时选 Sol high;测试强、任务边界稳、愿多等一会儿时,Terra max 在固定仓库轨道通过更多。Sol 当前促销已让旧成本优势明显缩小,不能再默认 Terra 一定更便宜。
换成体感:100 个同类仓库任务里,Terra max 的固定快照大约多完成 4 个;旧账单每题少约 $1.33、平均多等约 9.7 分钟。Sol 新促销后成本需重算,换一套任务方向也可能反转。
更偏左边:只想设一个日常默认档、需求经常来自语音或多轮补充、等待时间也重要。
更偏右边:工程测试成熟、失败能被拦截、等待不是主要成本,并愿意按自己的仓库复测。
AA 覆盖更广,偏向 Sol;Radar 是固定仓库代理任务,偏向 Terra max。它们测的不是同一件事。
指数点不是“智力百分比”。这里应同时看 2 点的历史综合差、4.3 个百分点的任务差、成本和等待。
CodeRabbit 的另一组 100+ 任务里 Sol 63.7%、Terra 40.7%,说明 harness、提示和任务形状足以反转结论。
普通任务先 high;架构、安全、迁移和语义终审直接 xhigh;若一次失败会浪费数小时、造成重大返工或结果难验证,可以直接 Max。
换成体感:high 到 xhigh 在 7 月 23 日历史快照的 100 个同类任务里不到多完成 1 个,却每题多约 $1.49、等 4.7 分钟;xhigh 到 Max 大约多完成 4 个,再多约 $2.70、等 9.2 分钟。
更偏左边:高到 xhigh:多付约 30% 历史单题成本,主要买更充分的语义、架构与审查。
更偏右边:xhigh 到 Max:再多付约 42%,历史仓库轨道多 4.0 个百分点;只对高价值尾部划算。
低风险任务失败后再升档通常更省;失败会造成大额时间损失时,重复跑本身也有成本。
Max 不是“永远最后一步”。决定是否跳档,应比较升档费与失败后的重跑、人工返工和机会成本。
Ultra 是多代理并行,不在这条单代理阶梯上。不能拆成独立支线时,Ultra 不会自动比 Max 更聪明。
开放判断、广泛知识与更快周转偏 Sol xhigh;固定仓库和强测试可能偏 Terra max。成本方向要用当前 Sol 促销与自己的输出长度重算。
换成体感:7 月 23 日历史快照的 100 个同类仓库任务里,Terra max 大约多完成 4 个;按历史价格折算每题少约 $2.82,但多等约 5 分钟。这不能外推成开放式任务也更强。
更偏左边:需求含大量隐含取舍、要自己发现边界,或任务并不只是改仓库和跑测试。
更偏右边:输入和成功条件固定,工具链成熟,最终结果能由自动化验收。
AA 更像多科综合考试;Radar 更像同一套真实仓库上机考试。
一个模型可以综合能力更高,却在特定上机环境中没有更高通过率;这不是数据错误。
企业上线应优先使用自己的任务成功率,公开榜单只负责帮你缩小候选范围。
Luna medium / high 继续做材料助手;降价 80% 后,计划已写清、测试可自动验收的批量实现可试 xhigh / max,但最终方案和关键代码仍由 Sol / Claude 主模型批准。
换成体感:7 月 23 日历史快照的 100 个同类仓库任务里,Luna max 约完成 59 个、Sol medium 约完成 61 个;按历史价格折算每题约 $0.49 对 $3.36,但 Luna 平均多等约 18.5 分钟。它是低价执行候选,不是更聪明的主脑。
更偏左边:Luna 独立完成:逐条抽取、去重、分类、文件地图;或执行已冻结计划、补测试和跑验收。
更偏右边:强模型接手:澄清模糊需求、决定证据是否可信、解释矛盾、设计架构和最终批准。
只读不是“完全不用思考”,但任务能拆成可核对的小结果,降低了对总体判断能力的要求。
让 Luna 报告文件路径、原句、行号和未确认项,比让它直接写结论可靠。
OpenAI 现在也建议由 Sol 解决不确定性和写计划,再让 Luna 执行明确改动、补测试并运行验收;独立 Radar 数据则说明这条路线必须保留测试兜底。
这四项满足得越多,越可以跳过逐级尝试;否则从 high / xhigh 开始通常更合算。
社区同时报告 Sol 的强执行力,以及范围膨胀、等待过长等问题。论坛环境不可控,所以只提炼三条可验证规则:任务分阶段、提前写停止条件、关键结果由测试和独立审查确认。
Luna 实际怎么干活
逐条抽取、去重、分类、文档目录和固定格式草稿。要求返回原文、路径与未确认项。
仓库地图、日志解释、测试失败归因和来源初筛。它可以思考,但不承担跨来源的最终取舍。
Sol / Claude 决定证据可信度、架构、关键补丁和最终结论;不要让整理材料的助手批准自己。
线程、子代理、worktree 与多人模式
反方论证和缺口搜索可以交给便宜子代理;它的价值是提醒主模型“可能漏了什么”,不是把廉价答案当最终裁决。只有高风险决策才值得再用昂贵模型做第二次反证审计。
Claude Code 对照
每张卡先给能直接照做的选择,再保留技术证据。模型只是起点;范围、测试、检查点和审查决定最终能不能放心交付。
先让强模型把目标、约束和可验证结果做清楚。预算平衡可从 Opus 5 high / Sol high 起;核心语义理解失败时换强模型,而不是反复重跑。
Fable 5.1 有 Cursor 模糊多文件实测;Astra 有 AA 工作任务与长程代码信号,但未在当前 CursorBench 出现。不能由榜单把它们固定成产品或编码的专职角色。已有命令、测试和日志时,Sol 仍是可靠预算起点。Astra 在固定长任务框架用更少输出与步骤到达相近通过率,值得在复杂任务复测。
DeepSWE:Astra xhigh 74%±3 / $6.52,Sol max 73%±3 / $6.46;误差重叠。普通 Token 单价高 2.5 倍,并未让这条平均任务账单也高 2.5 倍。先做一个能运行的代表页面,再检查视觉、响应式与交互。不要把一次漂亮演示当成可上线的完整产品。
Fable 5.1 的 Cursor 与 Vals 应用信号支持候选资格;K3 保留视觉、React、3D 专项。两者都需要同视口截图、构建与真实操作验收,不能据此宣布所有前端任务第一。能稳定复现的小问题可用 Sol 或明确任务执行者;根因模糊、跨系统或失败昂贵时用 Astra / Fable 5.1。语气自信不是因果正确。
目前没有同口径证据支持 Debug 一律属于某模型。让它给出假设、最小复现和可区分原因的实验;认真尝试仍理解错核心语义时换强模型。先建立可恢复检查点、有效权限和验收。谁能安全持续完成你的任务,要靠同任务试跑,不由模型性格或最大上下文决定。
DeepSWE 9/3:Astra xhigh 74%±3、Sol max 73%±3、Gemini 3.8 high 74%±1,区间重叠。Gemini 平均 $2.36 但 166 步;Fable 5.1 暂无同版本 DeepSWE,不能继承旧 5。先完成实现者自测,再让没有参与实现的模型找反例和可复现问题;独立复核不是禁止自审,更不能代替测试。
Fable 5.1 的 CodeRabbit 两种配置没有显示升档普遍增益,且不能直接对排不同时间和 pipeline 的 Sol 数据。高风险动作继续服从实际授权与发布门。旧 Fable 5 不能代表 5.1。新版已有更强 Cursor 多文件信号,普通输入 / 输出仍为 Opus 两倍,但缓存读取是 Opus 的一半;真实成本取决于任务和用量。
它们都能规划、实现和审查。Fable 5.1 在 Cursor 多文件任务靠前,Astra 在终端和 PDF 任务领先的点位更高;这是评测与任务差异,不是固定职业分工。
CursorBench 68.0% 对 67.2% 只是相邻点位;AA v4.2 的 Fable medium 是 50(估算),Sol max 为 51。API、代理框架、档位和任务不同,不能写成通用等价。
Fable 5.1 在 Cursor 从 xhigh 升 max 只增加 0.6 个百分点,平均费用多约 38.5%;差异未必显著。关键失败足够昂贵时仍可以直上 max,不机械逐级试。
普通输入 / 输出单价如此,但 DeepSWE Astra xhigh 与 Sol max 的平均费用为 $6.52 对 $6.46,通过率区间重叠;Astra 输出和步骤更少。换到 AA v4.2 max 又是 $2.57 对 $1.25。
Ultra 属于多代理编排;Claude Code ultracode 当前发给模型的是 xhigh 并组织工作流。它们没有可直接继承的 max 成绩,也不适合靠并行加速每一条串行难题。
当前 Claude 前沿主力;复杂多文件、研究和长交付候选
成熟的 Claude 质量与成本平衡主力
边界明确的日常主力、批量执行与团队成员
旧版历史基线;API 仍 Active
成熟旧流程与历史对照
快速、便宜的分类、搜索和窄任务助手
保留旧方法的原始快照,仅用于追溯当时升档成本;不能与当前 v4.2 或 Fable 5.1 的新表相减。整套账单不是一次普通任务价格。
分类、抽取和低风险辅助;不要独自处理高风险开放任务。
清楚、可验收的日常任务;在 Cursor 多文件任务中已与 Sol xhigh、Terra max 同档。
Opus 5 的 API 与 Claude Code 默认档;本表仅保留历史 AA 曲线,当前前沿比较看 v4.2。
困难编程、架构和长链路;只有 high 的失败代价明显时再升。
关键尾部和自己的 A/B 证明确有收益时使用;不是“默认更稳”的常开档。
怎么用:需求清楚、结果易验收先 medium / high;困难编程、架构和长链路再用 xhigh。当前 CursorBench 的 Opus 5 high → xhigh 从 66.7% 到 69.3%,费用约增 88%;xhigh → max 多 0.7 个百分点、费用约增 12%。这是 Opus 5 的具体任务数据,不能套给 Fable 5.1 或 Astra。
分数越高表示在这套 Cursor 任务里完成得更好;费用已按各模型的输入、缓存写入、缓存读取和输出挂牌价计算。它不是通用智商,也不是你的固定账单。
CursorBench 69.4% / $4.80;API / Code 官方默认 high。medium 为 68.0% / $3.53,可先在自己的日常任务复测。
CursorBench 为 66.2%—68.0% 对 67.2%;这是同一产品里的相邻点位,不是所有任务能力等价,也不能套到 AA 估算档。
CursorBench 为 67.0% / $1.93 与 69.2% / $2.38;强计划加可靠验收后是较低成本候选,不能只看每 Token 单价。
Fable 5.1 从 72.8% 到 73.4%,只多 0.6 个百分点;平均费用从 $6.96 到 $9.64,多约 38.5%。自己的失败损失决定是否值得。
DeepSWE v1.1 在同一 mini-swe-agent 上运行 113 个原创任务。通过率区间重叠时不判唯一冠军;成本、输出和步骤越低,表示在这套任务里更节制,不代表所有项目都更快。
与 Sol max 区间重叠、平均费用相近,输出约一半、步骤不到一半;不能据此保证每个真实项目都更快或更便宜。
进入同一长程代码领先档且平均费用较低;更多 Token 和步骤仍有等待与失败恢复成本,不是所有任务的无条件替代。
与 Astra、Gemini 3.8 同为 74% 点位,区间重叠;不能单凭取整点位宣布唯一冠军。
与 Opus 同档;当前促销后成本更低、输出更短、步骤更少,适合可自动验收的工程闭环。
这是旧 Fable 5;当前原榜未出现 5.1,不得换名继承。旧版账单也不能当新版缓存优惠后的费用。
与 K3 同点且区间重叠,已进入开放权重前沿;成本低于 Sol / Opus,但步骤明显更多。
也处在同一宽置信区间;低挂牌价带来较低账单,但步骤和输出仍偏多。
与 GPT-5.5 xhigh、Luna max 同点位;价格仍有优势,但没有复现 CursorBench 的最高点位。
长程通过率已到可用区间且成本很低;仍需强计划和测试,不能把这条轨道当通用推理等价。
3.7 保留效率优先流程;当前原榜配置为 medium,不沿用旧 high 行。与 3.8 Token 同价不代表任务总成本相同。
达到合格代码执行线且极便宜;比 Sol max 点估计低 10 个百分点,更适合强计划和测试兜底后的支线。
已经达到可用代码专项;当前公开运行成本高于 GLM-5.3 Flash,仍可作为不同模型家族的低价代码候选。
中文、视觉与阿里生态仍有价值;长程代码不应按其 AA 综合分直接类比 Sol xhigh。
通用代码不是前沿;法律、金融和可恢复长代理才是正式收录理由。
只适合计划明确、可自动验收的低风险支线;低价可能伴随更长循环。
手机上可左右滑动;相差不到约 1 分时先按同档,再看成本、等待和自己的验收结果。
| 模型与档位 | 任务得分 | 平均成本 | 大白话怎么读 |
|---|---|---|---|
| Fable 5.1 max | 73.4 | $9.64 | 本表最高点位;仅比自身 xhigh 高 0.6 个百分点而费用多约 38.5%。公开页未给配置置信区间,不据小差距宣布稳定胜负。 |
| Fable 5.1 xhigh | 72.8 | $6.96 | 困难多文件候选;不把这条 Cursor 实测等同于 AA v4.2 的 xhigh 估算。 |
| Grok 4.6 xhigh | 70.8 | $2.81 | 较低平均费用的前沿候选;DeepSWE 当前为 medium 67%±2,配置与任务不混用。 |
| Fable 5 max(旧版) | 70.5 | $17.32 | 旧版对照;不继承给 Fable 5.1,也不再称当前点估计最高。 |
| Opus 5 max | 70.0 | $8.23 | 能力敏感的关键尾部;不要仅因“更放心”而常开。 |
| Grok 4.6 high | 69.9 | $2.34 | 只比 xhigh 低 0.9 分;适合先做日常 A/B,重要事实和长期无人值守仍需复核。 |
| Fable 5.1 high | 69.4 | $4.80 | API / Code 官方默认,适合作能力优先起点;与 Sol high 63.5% 的差是 5.9 个百分点,不是智力增幅。 |
| Opus 5 xhigh | 69.3 | $7.35 | 困难多文件与架构;距 max 仅 0.7 分。 |
| Gemini 3.8 Flash high | 69.2 | $2.38 | 同版本两条代码方法支持较低成本工程候选;不继承给 Cyber 受限分支。 |
| Fable 5.1 medium | 68.0 | $3.53 | 日常任务可先试;邻近 Sol max 67.2%,不是跨任务等价。 |
| Sol max | 67.2 | $5.69 | 与 Opus high 同档;终端和测试闭环仍有独立优势。 |
| Gemini 3.8 Flash medium | 67.0 | $1.93 | 边界明确且验收可靠时可先试,质量不足再升 high 或回强主模型。 |
| Opus 5 high | 66.7 | $3.91 | Claude 日常高质量默认;先从这里开始。 |
| Fable 5 high(旧版) | 66.5 | $8.77 | 旧版同任务对照,不是 5.1 的费用或分数。 |
| Fable 5.1 low | 66.2 | $2.90 | 在此 Cursor 任务中邻近 Sol max,但官方提示 low 可能减少检索;不能照搬到时效研究和高风险任务。 |
| Terra max | 64.9 | $2.31 | 按原用量乘 7 月 30 日新价;更依赖清楚边界与自动测试。 |
| Sol xhigh | 64.5 | $3.88 | 复杂仓库、架构、安全和终审的 OpenAI 路线。 |
| Opus 5 medium | 64.3 | $3.29 | 清楚、可验收的 Claude 日常任务。 |
| Sol high | 63.5 | $2.79 | OpenAI 日常严肃编程默认;与 Opus low 同档。 |
| Opus 5 low | 62.8 | $2.55 | 低风险辅助;不要因单榜接近 Sol high 就替代严肃主线。 |
| Opus 4.8 max | 62.3 | $5.77 | 旧流程基线;新任务同价应先试 Opus 5。 |
| Sonnet 5 max | 61.5 | $4.30 | 按当前标准价,升到 max 后仍不一定比 Opus high 更省;日常更应看 medium / high。 |
| Gemini 3.7 high | 61.6 | $1.20 | 3.7 同版本效率基线;不把这行当 3.8 成绩,也不与 DeepSWE medium 配置混合。 |
| Luna max | 61.1 | $0.39 | 按原用量乘 7 月 30 日新价;需要测试兜底,不能按分数替代高端主控。 |
| K3 max | 60.8 | $2.70 | 模糊多文件任务已可用,但没有压过 Opus / Sol 高档位;视觉和长上下文优势需看其他轨道。 |
| Sol medium | 60.0 | $1.95 | 相同 Cursor 框架中的日常档对照,不等于 AA 的 medium 指数。 |
| K3 high | 59.7 | $1.89 | 与 K3 max 只差 1.1 分;日常 Kimi Code 仍先从 high 开始。 |
| Sol low | 52.6 | $1.01 | 低风险明确任务参考;不能只因名称与 Fable low 相同就认定推理预算或能力相同。 |
9/5 标准 API 每百万 Token:Fable 5.1 / Astra 普通输入输出同为 $10 / $50,但缓存读为 $0.25 / $1;Opus 5 为 $5 / $25,Sonnet 5 为常规标准价 $2 / $10,Sol 当前促销 $4 / $20(至少到 2026-11-21)。AA 的加权任务费是评测权重与实际 token/缓存用量折算的平均测评任务费,不是报价、成功任务成本或会员扣量;同单价不等于同任务账单,effort、缓存、工具、重试与人工返工必须另算。
opusplan官方别名:Opus 负责计划,Sonnet 负责执行。适合计划需要更强判断、而实现边界已经稳定的任务。
ultracodeClaude Code 的动态工作流编排,当前建立在 xhigh 上;它不是 API 的第六个 effort,也不要和 OpenAI Ultra 混同。
每个助手有独立上下文,可指定更便宜模型与 effort。适合读大量日志、测试、文档,不必把噪声塞回主线程。
只适合独立研究、模块或竞争假设。总 token 明显更高;顺序任务和同文件修改不要开团队。
Codex × Claude × GLM / K3
| 任务形状 | 计划 | 执行 | 审查 |
|---|---|---|---|
| 需求模糊、需要先把问题讲清 | Astra high / xhigh 或 Fable 5.1 high / xhigh;成熟流程可保留 Sol / Opus 5 | 计划稳定后交给 Sol high 或 Gemini 3.8 high;成本敏感、测试强且可回滚时可试 GLM-5.3 Flash max | 换另一家模型只读审查,优先找遗漏和可复现错误 |
| 边界清楚的日常功能 | 主执行模型自己做短计划即可 | Sol high;预算型流程试 Terra xhigh / max、GLM-5.3 Flash max 或 Sonnet 5 high | 机器测试先行;高风险部分再用不同模型审查 |
| 架构、安全、复杂迁移 | Astra / Fable 5.1 xhigh;失败代价高且有独立验收时可直接 max,不强制逐档重跑 | 按模块拆分;边界稳定部分降到 Sol high / Sonnet 5 | 未参与实现的强模型 + 全量测试 + 人工批准 |
| 反方论证、缺口与证据审计 | 主模型先写当前结论和证据标准 | Luna high / Sonnet 5 / Haiku / GLM-5.3 Flash 做便宜的反例搜索 | 强模型判断反例是否成立;廉价代理不能直接推翻结论 |
停止规则:理解错核心语义时回到强模型;验收已满足且复核不再提供新失败证据时停止。
停止规则:重复失败或返工成本超过节省的模型费用时停止低价重试并升级。
停止规则:无法新增原始证据时,不靠多开代理制造确定性;保留明确未知。
停止规则:模块依赖反复变化、共享写入过多或协调成本超过收益时,退回单主线。
历史 VIKTOR 公司任务中,Sol 与旧 Fable 5 调整后都为 76%,总成本约 $33.55 对 $96.35;单次运行误差约 2—3 个任务。这不是 Fable 5.1 的结果,也不能外推成所有公司都相同。
查看评测方法与完整结果 ↗Anthropic 公布的百万行 Bun 迁移先建立规则手册,再由 12 个 Sonnet worker 扇出执行、较强模型复核;合并前测试全绿仍出现 19 个回归,说明自动测试与人工审查都不能省。
查看完整迁移复盘 ↗K3 更适合超长资料、多模态输入、Kimi 生态或并行研究命中明确优势时加入;普通代码主线先把 Codex / Claude 的验收流程跑稳。
查看 K3 普通、集群与 1M 上下文指南 →把模型接进网站或企业流程
模型调用费 + 缓存与长上下文 + 重试 + 工具调用 + 人工返工 + 等待损失 ÷ 最终成功任务数
挂牌“每百万 token”只是第一项。便宜模型如果重试更多、输出更长或需要人工修,可能反而更贵。上线前用自己最常见、最昂贵和最危险的任务分别建样本;不要只测平均题,也不要把公开榜单的通过率直接当企业 SLA。
最后由自己的任务拍板
每档差 1 分、差一两题或置信区间重叠时按同档;再由等待时间、预算和人工返工决定。
最后再总结一次
来源、日期与限制
Radar 是滚动社区样本,运行环境、配额与模型服务会变化;AA 总成本是整套评测成本;厂商发布页中的自报榜单只作为厂商证据。本文没有把不同 harness、不同日期或不同代理框架的数字硬平均。