模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Google效率价值与成熟流程核验 2026-08-15

Gemini 3.7 Flash

高速多模态理解、Google 搜索与地图工具、长流程代理、高频编程循环和金融研究

已有跨来源证据

AA v4.2 high 45;保留效率价值与成熟流程。新长程工程及多文件任务优先与 Gemini 3.8 做同任务比较。

AA v4.245 · high · 原页未标估算 · 核验 2026-09-05

上下文
1M
默认推理
medium
API 输入
$0.75 / M
API 输出
$3.75 / M
开放权重
判断把握
中高

高速与工具生态要和长程成功率分开看

Gemini 3.7 Flash 相当于哪个常用档位

一句话:3.8 已发布并有更强的同版本代码证据,3.7 仍可保留给效率优先与已有稳定流程。当前 AA v4.2 为 45,DeepSWE 最佳展示是 medium 65%±3;旧 high 65%±2 不再当当前记录。
DeepSWE · 原创长程工程medium 65%±3 · $2.03 / 题
熟悉的参照Gemini 3.8 high 74%±1 · Grok 4.6 medium 67%±2 · DeepSeek Pro max 63%±6

按 100 道同类长任务粗略理解,它的点估计比 67% 组少约 2 道,属于很接近的一档;但不能据此说日常推理也全面等于 GPT-5.5 xhigh。

CursorBench 3.2 · 模糊多文件high 61.6% · $1.20 / 题
熟悉的参照Terra max 64.9% · Luna max 61.1% · K3 max 60.8% · Sol medium 60.0%

在需要自己找文件、补齐需求的 Cursor 任务里,它和 Luna max、K3 max、Sol medium 同一中间带,成本更低;遇到难规划和深审查,不要仅凭这条榜单替代强模型。

Google API · 介绍价$0.75 输入 / $3.75 输出
熟悉的参照Luna $0.20 / $1.20 · Terra $2 / $12 · Grok $2 / $6

它比 Terra 和 Grok 的输入更便宜、输出也低于 Grok,但仍贵于 Luna。2027 年价格翻倍,因此长期产品不能只按当前优惠价做预算。

Vals · 专业工作金融代理进入领先组
熟悉的参照该专项也有 Muse 1.2 与 Opus 5 等强项模型

适合把它作为有 Google 工具和多模态输入的金融研究候选;专项领先不等于法律、代码和所有日常任务都同样领先。

怎么实际使用

高频开发、网页与 UI、多模态资料、Google 搜索 / 地图 / Workspace 工具优先试 high;先让 Opus / Sol 写清复杂计划,再交给 Gemini 执行,通常比让它独立承担高风险架构更稳。

不要怎样误读

当前 AA v4.2 已有 45 分,不再称缺综合分。3.7 的历史与效率用途继续保留,但不继承 3.8 新成绩,也不把旧版本专题当最新旗舰选择。

证据快照:2026-09-05 · 旧版本仍可用

集中查看

这个模型的主要判断

综合能力

AA v4.2 high 45;保留效率价值与成熟流程。新长程工程及多文件任务优先与 Gemini 3.8 做同任务比较。

实际编程

DeepSWE 当前最佳 medium 65%±3%;CursorBench high 61.6%。最佳已测档不总是 highest effort;3.8 的新成绩不继承给 3.7。

使用限制

两种独立代码方法已满足正式收录门槛,但发布仍新、工具调用可能偏冗长;搜索、地图、缓存存储和 2027 年后的价格要分别核算。

当前状态

2026-08-13 发布;Gemini API、AI Studio、Antigravity 与 Android Studio 已提供

价格口径

官方介绍价至 2026-12-31;2027-01-01 起输入 / 输出 / 缓存升至 $1.50 / $7.50 / $0.15

直接核对

本页的关键来源

官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。