模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

DeepSeek低成本可验收候选核验 2026-08-29

DeepSeek V4 Flash 0731

Max 档下可验收的批量抽取、分类、草稿与低风险客服试点

已有跨来源证据

AA v4.2 精确 0731 max 41;Vision 分支为 42,不能借用。适合强计划、可验收、允许重跑的低风险任务。

AA v4.241 · max · 0731 · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
max
API 输入
$0.44 / M
API 输出
$1.32 / M
开放权重
MIT
判断把握
中高

先定边界,再谈省钱

它可以试哪些工作,哪些不能独立交给它

以下能力、成本和用途判断只把 DeepSeek V4 Flash max 与其他模型对照。AA 与 DeepSWE 已提供 max 同口径结果;Vals 测的是精确 0731 的 high,只用来补充版本表现,不冒充 max。它已是低成本可验收候选,仍不适合替代前沿主脑。
综合能力AA v4.2:Flash max 41 vs Luna max 43

2026-09-05 同版综合指数;42 是 Flash Vision 分支,不是普通 0731。下方 51.8 / 52.3 的旧表保留为 8 月历史,不能把换版后的分数变化称为降智。

峰谷价格(9 月 5 日核验)非峰 $0.22 / $0.66;峰时 $0.44 / $1.32

按 AA 的 7:2:1 缓存输入/普通输入/输出混合口径,非峰约 $0.115 / 百万 token、比 Luna 低约 34%;峰时约 $0.230、反而比 Luna 高约 32%。便宜与否现在取决于调用时段,不能再沿用调价前结论。

长程代码53% vs Luna max 67%

DeepSWE 当前 113 个原创工程任务里,Flash max 平均 $0.46 / 题;旧 $0.10 是调价前记录。通过率比 Luna max 低 14 个百分点,便宜不等于更稳或更快。

社区真实项目怎么用

真实案例更支持“执行者”,而不是“独立负责人”

下面是截至 2026-08-15 可回查的社区自述,不是统一实验。它们的仓库、提示词、代理框架、服务商和推理档可能不同,因此只用来观察反复出现的用法,不拿单个成功故事当通过率。

Kotlin 核心插件 · oh-my-pi / LSP · 人工验收

合并 9 个 Minecraft 插件

作者报告:作者称 4 小时内完成,经过 2—4 轮修错后,二进制从约 45MB 降到 12MB、内存降约 70%,API 花费约 $1.63。

可复制的经验:适合边界明确、能反复编译和测试的仓库改造;“需要数轮修错”本身也说明不能省掉验收。

查看原讨论 ↗
先规划、再实现 · 规格 / QA / 性能子任务

Django 功能按计划执行

作者报告:同一讨论中的用户称,Flash 的首版计划漏项;经 Fable / GLM 找缺口并由人修改计划后,Flash 执行准确。

可复制的经验:这是最有代表性的边界:强模型或人工先把任务讲清,Flash 再做低价执行,比让它自己规划到底更稳。

查看原讨论 ↗
约 4MB 可执行文件 · 300 个 opcode · 约 50 个顺序子任务

Ghidra 逆向与文档整理

作者报告:作者称生成约 800KB 文档和 7,000 行相关实现,花费约 $3;这是工具调用密集、结果可逐步核对的专项案例。

可复制的经验:擅长的不是“凭空懂所有底层逻辑”,而是工具反馈明确、任务能切成很多可检查步骤时持续推进。

查看原讨论 ↗
约 2,400 万输入 / 600 万输出 · 高缓存命中

连续 7 天 API 编程

作者报告:作者称总花费 $1.87,并完成一次杂乱的生产重构;同时明确表示所用 API 没有视觉输入,需要人工描述截图。

可复制的经验:成本优势很依赖上下文缓存;没有视觉、缓存率低或输出很长时,不能照搬这个账单。

查看原讨论 ↗
1,829 次运行 · 1.534 亿 token · 插件作者自述

代理循环中的日常主执行

作者报告:作者称约 19 / 20 个普通回合使用 Flash,真正困难的回合切到 Pro;低账单来自特定订阅与高缓存率。

可复制的经验:最可复制的不是具体价格,而是“便宜模型跑大多数可验收步骤,困难回合主动升档”的路由。

查看原讨论 ↗
把“差 1 分”翻译成真实任务

历史读表示例:综合分差 1 分,不等于真实能力只差 1%

以下保留 2026-08-15 的 AA v4.1.1 单项与当时价格,展示如何读分差,不当今天排名或账单。当前 AA v4.2 及峰谷价见上方;Flash max 的可用角色仍是计划明确、测试兜底的执行者。

本站当前判断

Sol medium 仍是更稳的通用分水岭

Flash max 更像“流程写清后很能干、很便宜的执行者”;Sol medium 更像“要求没说清时,也更有机会自己想明白的负责人”。Flash max 和 Luna max 都已可承担一部分严肃工作,但需求含糊、要自行取舍或错误难发现时,Sol medium 仍更稳。

为什么仍选 Sol
对 Flash max:Sol medium 的综合指数为 55.6 对 51.8。若按相同比例换算成 100 次,终端任务约完成 86 次对 79 次;6,000 道知识题则约每 100 道答对 58 道对 40 道,Flash 的答对量约少三成。这些不同方向同时领先,不能用某个代理子项的接近覆盖。
为什么别的榜会反过来
为什么有人会说 Flash 更强?在 AA 的代理指数里 Flash max 为 48.4,略高于 Sol medium 的 47.9;在 τ³ 银行工具流程中也是 39.4% 对 36.5%。这里的“工具”是评测框架提供的命令、网页或业务接口,不是直接在 Codex 或 Claude Code 成品里测真实仓库,所以只能说明少数固定流程可能更好。
Luna max 怎么看
Luna max 也属于可用的低成本执行档:每 100 道长资料题约答对 78 道,Sol medium 约 74 道。但若按 100 次换算,终端任务约完成 81 次对 86 次,知识题约答对 43 道对 58 道,代理指数也略低,所以不能写成整体更好。

一句话选择:强测试、可回滚、计划写清时可试 Flash max / Luna max;语音需求含糊、跨模块取舍多或要一次做对时,至少从 Sol medium 起步。

“会用工具”到底是什么意思

Agentic Index 测的不是聊天,而是“接上工具后能不能把事做完”

基础模型只负责接收内容并生成内容;评测程序再提供工具和执行循环。分数衡量的是“模型 + 这套固定控制程序”的共同结果,不是模型脱离环境后的纯智力。

  1. 01
    工具清单

    明确告诉模型可以打开网页、运行命令、查询账户或提交业务操作。

  2. 02
    参数规则

    模型必须按固定格式填写命令、网址、账户号等参数,不能只在文字里声称已经做过。

  3. 03
    连续循环

    程序执行工具,把真实结果返回给模型;模型继续判断下一步,直到完成或步数用完。

  4. 04
    结果验收

    最后检查交付文件、命令结果或后台数据库是否真的正确,不只看回答听起来像不像。

开放式知识工作

例如查网页、分析数据、运行命令并生成报告;目标较开放,最后比较交付物质量。

银行客服流程

例如查政策、查账户、提交争议;步骤较封闭,最后直接检查数据库状态是否改对。

不能直接外推:Codex 和 Claude Code 也会给模型文件、命令与测试工具,但它们的系统提示、上下文整理、文件接口和验收流程都不同。因此 Flash 在 AA 这套程序里略高,只能说明它会使用某些工具流程,不能证明它在 Codex 或 Claude Code 的真实仓库里整体更强。

Terminal-Bench 2.1 · 89 个任务终端任务通过率

更接近真实命令行编程、系统管理和数据处理;把百分点差距换成 100 个同类任务,只用于帮助理解,不代表你的项目必然相差同样数量。

AA-Omniscience · 6,000 道题知识题准确率

看模型在不知道答案时是否容易猜错。这里采用原始准确率,不把会拒答和会胡猜的模型混成一个“智力百分比”。

AA-LCR · 100 道题,单题约 10 万 token长资料推理准确率

看模型能否跨多份长文档找证据并推理,不是只测试能否把 100 万 token 塞进窗口。

模型与常用档AA 综合混合价 / M终端任务知识题长资料
DeepSeek V4 Flash max本页主角
AA 综合51.8
混合价 / M$0.06
终端任务78.7%
知识题40.4%
长资料74.3%
GPT-5.6 Luna max历史低成本参照
AA 综合52.3
混合价 / M$0.17
终端任务80.9%
知识题42.7%
长资料78.3%
GPT-5.4 xhigh历史可用下限
AA 综合53.1
混合价 / M$2.18
终端任务78.3%
知识题50.8%
长资料77.7%
GPT-5.5 high历史日常常用
AA 综合54.7
混合价 / M$4.35
终端任务79.4%
知识题57.0%
长资料79.0%
GPT-5.5 xhigh历史严肃常用
AA 综合56.3
混合价 / M$4.35
终端任务84.3%
知识题58.0%
长资料79.0%
GPT-5.6 Sol medium历史常用执行档
AA 综合55.6
混合价 / M$4.35
终端任务86.1%
知识题57.8%
长资料74.3%
GPT-5.6 Sol high历史日常主力
AA 综合57.3
混合价 / M$4.35
终端任务87.3%
知识题58.4%
长资料75.3%
对 Luna max:综合分只差 0.5,长程代码仍低 14 个百分点

AA 单项换成 100 次体感:终端约 79 对 81,知识题约 40 对 43,长资料约 74 对 78;但 DeepSWE 原创工程任务是 53% 对 67%。Flash 更便宜,却不能因此写成同样稳。

对 GPT-5.4 xhigh:终端几乎打平,知识可靠性不是同一水平

换成 100 次体感:终端约 79 对 78,几乎一样;知识题却约 40 对 51,Flash 少答对约 10 道;长资料约 74 对 78。DeepSWE 中两者也是 53% 对 52%,说明结构化代码比开放判断更接近。

对 GPT-5.5 high:终端接近,不代表能全面替代

换成 100 次体感:终端都是约 79;知识题约 40 对 57,Flash 少答对约 17 道,答对量低约三成;长资料约 74 对 79。接近的执行题不能覆盖知识可靠性差距。

对 Sol medium / high:执行差距可见,知识差距更大

换成 100 次体感:终端约 79 对 86 / 87,Flash 少完成约 7—9 次;知识题约 40 对 58,少答对约 18 道;长资料与 Sol medium 接近、比 high 低约 1 道。因此它适合强测试兜底的执行,不是含糊任务的主脑。

读表边界:表内百分比来自三套不同数据集,不能横向相加或平均;只能在同一列里比较模型。它们是带日期的公开快照,不是所有真实工作上的统一成功率,也不能被重新包装成一个“真实智力百分比”。 数据核验于 2026-08-15(UTC+8)

适合先小规模测试

省钱的前提,是结果能自动检查或人工兜底

01
批量抽取、分类和打标签

输入输出格式固定、机器能校验、允许重跑时,低价格最容易转化成真实节省。

02
知识库的低风险第一轮回答

只从检索到的段落回答并附来源;找不到、来源冲突或涉及承诺时,必须拒答或转人工。

03
客服草稿与问题分流

可先识别意图、找条款和生成草稿;退款、赔偿、账户处置等动作仍由确定性规则或人工批准。

04
按明确计划执行代码或文档

强模型已经写清计划,仓库又有自动测试时,可让它处理可回滚支线;不要让一次成功案例替代持续验收。

客服与知识库最低保护线

不是接上 API 就能放心上线

先用真实历史问题做离线测试,再把高风险回答留给规则和人工。

  1. 01

    只允许根据检索到的白名单资料回答,并把来源链接或文档编号一起返回。

  2. 02

    没有足够证据时输出“未找到”,不要鼓励模型猜一个看似完整的答案。

  3. 03

    高风险意图直接转人工;业务规则、价格、库存和账户动作由程序读取,不让模型自行编造。

  4. 04

    上线前用真实历史问题建立测试集,持续记录拒答率、错误引用、人工改写和升级转接率。

  5. 05

    优先用 DeepSeek 官方 API 复测;使用聚合 API 服务商时,先验证 0731 版本和 high / max 推理档确实生效。

为什么能进成本价值轨道,却不进旗舰榜

2026-09-05:AA v4.2 精确 0731 max 为 41;DeepSWE max 为 53%±4、平均 $0.46 / 题。8 月调价前的 $0.10 仅是历史记录。下方 AA 单项表保留 2026-08-15 v4.1.1,不与新指数混列;Vals high 仅作版本补充,不冒充 max。社区案例是不同框架、服务商与档位的自述,不是统一成功率。

下次复查:峰谷价已经生效;需要用自己的峰/非峰调用比例、缓存率、重试和人工返工重新核算成功任务成本。出现连续客服 / RAG 数据或新版本改动官方别名时,再核验用途与版本映射。

集中查看

这个模型的主要判断

综合能力

AA v4.2 精确 0731 max 41;Vision 分支为 42,不能借用。适合强计划、可验收、允许重跑的低风险任务。

实际编程

DeepSWE max 53%±4%、当前平均 $0.46/题;长程工程低于 Luna max 67%±4%。适合强计划与强测试支线,旧 $0.10 成本不当当前账单。

使用限制

本站仍只采用 Flash max。它适合计划明确、能自动验收和允许重跑的低风险支线,不承担架构、安全或最终批准;平均输出约 108K、步骤约 153。Vision Exp 仅在确需图片输入时试用。

当前状态

官方别名指向 0731;AA、Vals 与 DeepSWE 已形成三类独立信号。Vision Exp 是图像输入实验分支,不是通用能力升级

价格口径

本站计算器按峰时安全上限估算;工作日 UTC 01:00—04:00、06:00—10:00 为峰时,其余时段非峰价 $0.22 / $0.66、缓存 $0.007