模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Google高性价比多模态执行核验 2026-09-05

Gemini 3.8 Flash

多模态资料、Google 工具、有验收的多文件开发和长程代码执行

已有跨来源证据

AA v4.2 high 47,邻近 Sol medium 46 / high 48;原创长程工程和 Cursor 多文件任务的相对表现更突出,不能只按综合分选代码模型。

AA v4.247 · high · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
high
API 输入
$0.75 / M
API 输出
$3.75 / M
开放权重
判断把握
中高

两种独立代码方法,仍不是所有任务通吃

Gemini 3.8 Flash 为什么值得试代码执行

它的综合分接近 Sol medium—high,但在 DeepSWE 和 CursorBench 两种代码任务中更突出,已经具备正式执行候选的证据。低单题费用不等于每个项目都更快,3.7 的效率优先流程也不必无条件替换。
AA v4.2 · 综合题3.8 high 47
熟悉的参照Sol medium 46 · high 48;3.7 当前最高展示 45

这是同版综合指数的邻近参照,不是工程通过率。9 月 2 日文章中的旧 v4.1.1 分数不能拿来和当前 47 比能力下降。

DeepSWE v1.1 · 原创长程工程high 74%±1 · $2.36 / 题
熟悉的参照Astra xhigh 74%±3 · Sol max 73%±3

113 个任务、同一代理框架,区间重叠支持同一领先档;但约 143K 输出与 166 步说明它可能走得更长。费用是每题平均,不是含返工的成功任务成本。

CursorBench 3.2 · 多文件实现medium 67.0% / $1.93;high 69.2% / $2.38
熟悉的参照Sol max 67.2% · Opus 5 max 70.0%

第二种任务方法也支持较强代码执行与成本价值;1 个百分点左右不制造稳定冠军。它不是沿用 3.7 的榜分,也不是仅靠 Google 自报。

Vals Index v2 · 专业任务high 62.25%±1.01
熟悉的参照Sol max 63.71%±1.06

当前专业任务点位相邻但误差重叠;综合指数、代码通过率与这项经济任务权重不能相加。Vals 页仍列 2027 标准单价,不把该页费用当当前介绍价账单。

Google API · 介绍价与入口输入 $0.75 / 输出 $3.75 / 缓存读取 $0.075
熟悉的参照介绍价至 2026-12-31;2027 起对应单价翻倍

Gemini API、AI Studio 和 Antigravity 可用;音频、缓存存储与工具另按项目计费。3.8 Flash Cyber 属受限防守项目,不等于普通 Flash 具有相同权限。

怎么实际使用

多模态资料、Google 工具和有自动验收的多文件实现可先试 high;与现有 Sol / Gemini 3.7 同题记录通过率、耗时、步骤和账单。高风险规划及发布终审继续保留独立复核。

不要怎样误读

两种独立代码方法支持收录,但尚无本站长期生产稳定性记录。3.8 可能使用更多 token;不要把更高能力、输出速率、总任务耗时和费用合成一个“更快更省”的保证。

证据快照:2026-09-05 · 发布 2026-09-02

集中查看

这个模型的主要判断

综合能力

AA v4.2 high 47,邻近 Sol medium 46 / high 48;原创长程工程和 Cursor 多文件任务的相对表现更突出,不能只按综合分选代码模型。

实际编程

DeepSWE high 74%±1 / $2.36;CursorBench high 69.2% / $2.38,已有两种方法支持代码执行价值。

使用限制

生成与工具步骤可能较多;低单题费用不代表等待更短。3.8 Flash Cyber 为受限专用版本,不继承为普通 Flash 的权限或成绩。

当前状态

已有跨来源证据,最近核验 2026-09-05

价格口径

2026 年底前介绍价;音频输入、缓存、工具和后续标准价按官方对应项目计费。