点估计已达到可用的严肃代码区间,但误差较大。和 67% 组粗略只差 4 道 / 100 题,不代表每个项目都只差 4%;需求含糊、测试不足时体感可能放大。
DeepSeek低价长程代码专项核验 2026-08-29
DeepSeek V4 Pro 0813
Max 档下有测试兜底的长程代码、批量仓库任务和极度成本敏感的企业试点
- 上下文
- 1M
- 默认推理
- max
- API 输入
- $1.32 / M
- API 输出
- $3.96 / M
- 开放权重
- MIT
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。只用 max 档比较,先看成功任务成本
DeepSeek V4 Pro 0813 到底到什么水平
一句话:它仍是低价长程代码候选,DeepSWE max 63%±6;GLM-5.3 Flash 以更低公开成本达到相同点估计。当前 AA v4.2 为 42,不能用代码专项结果写成综合超过 K3,或替代前沿模型终审。它在这套已接近满分的仓库修复题上完全可用,但各家只差约 1~2 道 / 100 题,排行榜已经饱和,不能据此宣布全面超过 K3 或 Sol。
它仍明显便宜于 Sol / Grok,但不再是公开代码候选里最便宜的一档。max 可能生成更长、走更多步骤;真正该比较的是做成一件事的总价、等待、重试和人工返工。
适合先拿有测试、失败可回滚的任务做 15~30 题小测;如果连续误解需求,不要继续堆推理档,直接换成熟前沿模型。
只按 max 档使用:先由强模型或人写清目标、文件边界和验收测试,再让 Pro 执行;机器测试全绿后,由 Sol / Opus 做高风险终审。客服、检索和普通聊天不要因为代码榜强就默认换成 Pro。
代码准入来自 DeepSWE 与 Vals SWE-bench 两种方法;当前 AA v4.2 已有同版本 42 分,不再写“没有综合证据”。有综合分仍不代表达到通用前沿,定位继续是代码专项与成本价值。
证据快照:2026-09-05;SWE-bench 保留 8 月历史快照
集中查看
这个模型的主要判断
AA v4.2 精确 0813 max 42;长程代码是专项价值,不把代码强项推广为通用旗舰。
DeepSWE max 为 63%±6,和 Gemini 3.7 high、GPT-5.5 xhigh、Luna max 的区间相邻;Vals SWE-bench 为 96.4%,但该榜已接近满分,只能证明仓库修复可用,不能证明全面超过 K3 / Sol / Opus
两种方法已满足正式代码专项准入,但发布初期仍有循环、429、速度和 provider 差异反馈。峰谷价已生效;高风险架构、安全和最终批准仍需更成熟的前沿模型复核。
0813 正式版已在 App、Web 与 API 提供;官方发布 MIT 权重,原生支持 Responses API 与 Codex
本站计算器按峰时安全上限估算;工作日 UTC 01:00—04:00、06:00—10:00 为峰时,其余时段非峰价 $0.66 / $1.98、缓存 $0.022
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。