模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

DeepSeek低价长程代码专项核验 2026-08-29

DeepSeek V4 Pro 0813

Max 档下有测试兜底的长程代码、批量仓库任务和极度成本敏感的企业试点

已有跨来源证据

AA v4.2 精确 0813 max 42;长程代码是专项价值,不把代码强项推广为通用旗舰。

AA v4.242 · max · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
max
API 输入
$1.32 / M
API 输出
$3.96 / M
开放权重
MIT
判断把握
中高

从实际任务看

这款模型擅长哪些具体工作

以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。

只用 max 档比较,先看成功任务成本

DeepSeek V4 Pro 0813 到底到什么水平

一句话:它仍是低价长程代码候选,DeepSWE max 63%±6;GLM-5.3 Flash 以更低公开成本达到相同点估计。当前 AA v4.2 为 42,不能用代码专项结果写成综合超过 K3,或替代前沿模型终审。
DeepSWE · 原创长程工程max 63%±6 · 约 $1.67 / 题
熟悉的参照Gemini 3.7 medium 65%±3 · GPT-5.5 xhigh / Luna max 67% · K3 max 69%±5

点估计已达到可用的严肃代码区间,但误差较大。和 67% 组粗略只差 4 道 / 100 题,不代表每个项目都只差 4%;需求含糊、测试不足时体感可能放大。

2026-08-29 历史 · Vals SWE-bench Verified96.4%
熟悉的参照Opus 5 97.0% · Sol 96.2% · Fable 95.0%

它在这套已接近满分的仓库修复题上完全可用,但各家只差约 1~2 道 / 100 题,排行榜已经饱和,不能据此宣布全面超过 K3 或 Sol。

DeepSeek API · 当前峰谷价格非峰 $0.66 / $1.98;峰时 $1.32 / $3.96
熟悉的参照GLM-5.3 Flash 长期 $0.15 / $0.50 · Grok $2 / $6 · Sol 促销 $4 / $20

它仍明显便宜于 Sol / Grok,但不再是公开代码候选里最便宜的一档。max 可能生成更长、走更多步骤;真正该比较的是做成一件事的总价、等待、重试和人工返工。

真实使用反馈 · 发布初期规划与架构偶有亮点,也有循环、429 和速度波动
熟悉的参照不同 API provider、版本和并发条件不能混算

适合先拿有测试、失败可回滚的任务做 15~30 题小测;如果连续误解需求,不要继续堆推理档,直接换成熟前沿模型。

怎么实际使用

只按 max 档使用:先由强模型或人写清目标、文件边界和验收测试,再让 Pro 执行;机器测试全绿后,由 Sol / Opus 做高风险终审。客服、检索和普通聊天不要因为代码榜强就默认换成 Pro。

不要怎样误读

代码准入来自 DeepSWE 与 Vals SWE-bench 两种方法;当前 AA v4.2 已有同版本 42 分,不再写“没有综合证据”。有综合分仍不代表达到通用前沿,定位继续是代码专项与成本价值。

证据快照:2026-09-05;SWE-bench 保留 8 月历史快照

集中查看

这个模型的主要判断

综合能力

AA v4.2 精确 0813 max 42;长程代码是专项价值,不把代码强项推广为通用旗舰。

实际编程

DeepSWE max 为 63%±6,和 Gemini 3.7 high、GPT-5.5 xhigh、Luna max 的区间相邻;Vals SWE-bench 为 96.4%,但该榜已接近满分,只能证明仓库修复可用,不能证明全面超过 K3 / Sol / Opus

使用限制

两种方法已满足正式代码专项准入,但发布初期仍有循环、429、速度和 provider 差异反馈。峰谷价已生效;高风险架构、安全和最终批准仍需更成熟的前沿模型复核。

当前状态

0813 正式版已在 App、Web 与 API 提供;官方发布 MIT 权重,原生支持 Responses API 与 Codex

价格口径

本站计算器按峰时安全上限估算;工作日 UTC 01:00—04:00、06:00—10:00 为峰时,其余时段非峰价 $0.66 / $1.98、缓存 $0.022