2026-09-05 同版综合指数;42 是 Flash Vision 分支,不是普通 0731。下方 51.8 / 52.3 的旧表保留为 8 月历史,不能把换版后的分数变化称为降智。
DeepSeek低成本可验收候选核验 2026-08-29
DeepSeek V4 Flash 0731
Max 档下可验收的批量抽取、分类、草稿与低风险客服试点
AA v4.2 精确 0731 max 41;Vision 分支为 42,不能借用。适合强计划、可验收、允许重跑的低风险任务。
AA v4.2:41 · max · 0731 · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- max
- API 输入
- $0.44 / M
- API 输出
- $1.32 / M
- 开放权重
- MIT
- 判断把握
- 中高
先定边界,再谈省钱
它可以试哪些工作,哪些不能独立交给它
以下能力、成本和用途判断只把 DeepSeek V4 Flash max 与其他模型对照。AA 与 DeepSWE 已提供 max 同口径结果;Vals 测的是精确 0731 的 high,只用来补充版本表现,不冒充 max。它已是低成本可验收候选,仍不适合替代前沿主脑。按 AA 的 7:2:1 缓存输入/普通输入/输出混合口径,非峰约 $0.115 / 百万 token、比 Luna 低约 34%;峰时约 $0.230、反而比 Luna 高约 32%。便宜与否现在取决于调用时段,不能再沿用调价前结论。
DeepSWE 当前 113 个原创工程任务里,Flash max 平均 $0.46 / 题;旧 $0.10 是调价前记录。通过率比 Luna max 低 14 个百分点,便宜不等于更稳或更快。
真实案例更支持“执行者”,而不是“独立负责人”
下面是截至 2026-08-15 可回查的社区自述,不是统一实验。它们的仓库、提示词、代理框架、服务商和推理档可能不同,因此只用来观察反复出现的用法,不拿单个成功故事当通过率。
合并 9 个 Minecraft 插件
作者报告:作者称 4 小时内完成,经过 2—4 轮修错后,二进制从约 45MB 降到 12MB、内存降约 70%,API 花费约 $1.63。
可复制的经验:适合边界明确、能反复编译和测试的仓库改造;“需要数轮修错”本身也说明不能省掉验收。
查看原讨论 ↗Django 功能按计划执行
作者报告:同一讨论中的用户称,Flash 的首版计划漏项;经 Fable / GLM 找缺口并由人修改计划后,Flash 执行准确。
可复制的经验:这是最有代表性的边界:强模型或人工先把任务讲清,Flash 再做低价执行,比让它自己规划到底更稳。
查看原讨论 ↗Ghidra 逆向与文档整理
作者报告:作者称生成约 800KB 文档和 7,000 行相关实现,花费约 $3;这是工具调用密集、结果可逐步核对的专项案例。
可复制的经验:擅长的不是“凭空懂所有底层逻辑”,而是工具反馈明确、任务能切成很多可检查步骤时持续推进。
查看原讨论 ↗连续 7 天 API 编程
作者报告:作者称总花费 $1.87,并完成一次杂乱的生产重构;同时明确表示所用 API 没有视觉输入,需要人工描述截图。
可复制的经验:成本优势很依赖上下文缓存;没有视觉、缓存率低或输出很长时,不能照搬这个账单。
查看原讨论 ↗代理循环中的日常主执行
作者报告:作者称约 19 / 20 个普通回合使用 Flash,真正困难的回合切到 Pro;低账单来自特定订阅与高缓存率。
可复制的经验:最可复制的不是具体价格,而是“便宜模型跑大多数可验收步骤,困难回合主动升档”的路由。
查看原讨论 ↗历史读表示例:综合分差 1 分,不等于真实能力只差 1%
以下保留 2026-08-15 的 AA v4.1.1 单项与当时价格,展示如何读分差,不当今天排名或账单。当前 AA v4.2 及峰谷价见上方;Flash max 的可用角色仍是计划明确、测试兜底的执行者。
Sol medium 仍是更稳的通用分水岭
Flash max 更像“流程写清后很能干、很便宜的执行者”;Sol medium 更像“要求没说清时,也更有机会自己想明白的负责人”。Flash max 和 Luna max 都已可承担一部分严肃工作,但需求含糊、要自行取舍或错误难发现时,Sol medium 仍更稳。
- 为什么仍选 Sol
- 对 Flash max:Sol medium 的综合指数为 55.6 对 51.8。若按相同比例换算成 100 次,终端任务约完成 86 次对 79 次;6,000 道知识题则约每 100 道答对 58 道对 40 道,Flash 的答对量约少三成。这些不同方向同时领先,不能用某个代理子项的接近覆盖。
- 为什么别的榜会反过来
- 为什么有人会说 Flash 更强?在 AA 的代理指数里 Flash max 为 48.4,略高于 Sol medium 的 47.9;在 τ³ 银行工具流程中也是 39.4% 对 36.5%。这里的“工具”是评测框架提供的命令、网页或业务接口,不是直接在 Codex 或 Claude Code 成品里测真实仓库,所以只能说明少数固定流程可能更好。
- Luna max 怎么看
- Luna max 也属于可用的低成本执行档:每 100 道长资料题约答对 78 道,Sol medium 约 74 道。但若按 100 次换算,终端任务约完成 81 次对 86 次,知识题约答对 43 道对 58 道,代理指数也略低,所以不能写成整体更好。
一句话选择:强测试、可回滚、计划写清时可试 Flash max / Luna max;语音需求含糊、跨模块取舍多或要一次做对时,至少从 Sol medium 起步。
Agentic Index 测的不是聊天,而是“接上工具后能不能把事做完”
基础模型只负责接收内容并生成内容;评测程序再提供工具和执行循环。分数衡量的是“模型 + 这套固定控制程序”的共同结果,不是模型脱离环境后的纯智力。
- 01工具清单
明确告诉模型可以打开网页、运行命令、查询账户或提交业务操作。
- 02参数规则
模型必须按固定格式填写命令、网址、账户号等参数,不能只在文字里声称已经做过。
- 03连续循环
程序执行工具,把真实结果返回给模型;模型继续判断下一步,直到完成或步数用完。
- 04结果验收
最后检查交付文件、命令结果或后台数据库是否真的正确,不只看回答听起来像不像。
例如查网页、分析数据、运行命令并生成报告;目标较开放,最后比较交付物质量。
例如查政策、查账户、提交争议;步骤较封闭,最后直接检查数据库状态是否改对。
不能直接外推:Codex 和 Claude Code 也会给模型文件、命令与测试工具,但它们的系统提示、上下文整理、文件接口和验收流程都不同。因此 Flash 在 AA 这套程序里略高,只能说明它会使用某些工具流程,不能证明它在 Codex 或 Claude Code 的真实仓库里整体更强。
更接近真实命令行编程、系统管理和数据处理;把百分点差距换成 100 个同类任务,只用于帮助理解,不代表你的项目必然相差同样数量。
看模型在不知道答案时是否容易猜错。这里采用原始准确率,不把会拒答和会胡猜的模型混成一个“智力百分比”。
看模型能否跨多份长文档找证据并推理,不是只测试能否把 100 万 token 塞进窗口。
AA 单项换成 100 次体感:终端约 79 对 81,知识题约 40 对 43,长资料约 74 对 78;但 DeepSWE 原创工程任务是 53% 对 67%。Flash 更便宜,却不能因此写成同样稳。
换成 100 次体感:终端约 79 对 78,几乎一样;知识题却约 40 对 51,Flash 少答对约 10 道;长资料约 74 对 78。DeepSWE 中两者也是 53% 对 52%,说明结构化代码比开放判断更接近。
换成 100 次体感:终端都是约 79;知识题约 40 对 57,Flash 少答对约 17 道,答对量低约三成;长资料约 74 对 79。接近的执行题不能覆盖知识可靠性差距。
换成 100 次体感:终端约 79 对 86 / 87,Flash 少完成约 7—9 次;知识题约 40 对 58,少答对约 18 道;长资料与 Sol medium 接近、比 high 低约 1 道。因此它适合强测试兜底的执行,不是含糊任务的主脑。
读表边界:表内百分比来自三套不同数据集,不能横向相加或平均;只能在同一列里比较模型。它们是带日期的公开快照,不是所有真实工作上的统一成功率,也不能被重新包装成一个“真实智力百分比”。 数据核验于 2026-08-15(UTC+8)。
省钱的前提,是结果能自动检查或人工兜底
输入输出格式固定、机器能校验、允许重跑时,低价格最容易转化成真实节省。
只从检索到的段落回答并附来源;找不到、来源冲突或涉及承诺时,必须拒答或转人工。
可先识别意图、找条款和生成草稿;退款、赔偿、账户处置等动作仍由确定性规则或人工批准。
强模型已经写清计划,仓库又有自动测试时,可让它处理可回滚支线;不要让一次成功案例替代持续验收。
不是接上 API 就能放心上线
先用真实历史问题做离线测试,再把高风险回答留给规则和人工。
- 01
只允许根据检索到的白名单资料回答,并把来源链接或文档编号一起返回。
- 02
没有足够证据时输出“未找到”,不要鼓励模型猜一个看似完整的答案。
- 03
高风险意图直接转人工;业务规则、价格、库存和账户动作由程序读取,不让模型自行编造。
- 04
上线前用真实历史问题建立测试集,持续记录拒答率、错误引用、人工改写和升级转接率。
- 05
优先用 DeepSeek 官方 API 复测;使用聚合 API 服务商时,先验证 0731 版本和 high / max 推理档确实生效。
为什么能进成本价值轨道,却不进旗舰榜
2026-09-05:AA v4.2 精确 0731 max 为 41;DeepSWE max 为 53%±4、平均 $0.46 / 题。8 月调价前的 $0.10 仅是历史记录。下方 AA 单项表保留 2026-08-15 v4.1.1,不与新指数混列;Vals high 仅作版本补充,不冒充 max。社区案例是不同框架、服务商与档位的自述,不是统一成功率。
下次复查:峰谷价已经生效;需要用自己的峰/非峰调用比例、缓存率、重试和人工返工重新核算成功任务成本。出现连续客服 / RAG 数据或新版本改动官方别名时,再核验用途与版本映射。
集中查看
这个模型的主要判断
AA v4.2 精确 0731 max 41;Vision 分支为 42,不能借用。适合强计划、可验收、允许重跑的低风险任务。
DeepSWE max 53%±4%、当前平均 $0.46/题;长程工程低于 Luna max 67%±4%。适合强计划与强测试支线,旧 $0.10 成本不当当前账单。
本站仍只采用 Flash max。它适合计划明确、能自动验收和允许重跑的低风险支线,不承担架构、安全或最终批准;平均输出约 108K、步骤约 153。Vision Exp 仅在确需图片输入时试用。
官方别名指向 0731;AA、Vals 与 DeepSWE 已形成三类独立信号。Vision Exp 是图像输入实验分支,不是通用能力升级
本站计算器按峰时安全上限估算;工作日 UTC 01:00—04:00、06:00—10:00 为峰时,其余时段非峰价 $0.22 / $0.66、缓存 $0.007
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。