按 100 道同类长任务粗略理解,它的点估计比 67% 组少约 2 道,属于很接近的一档;但不能据此说日常推理也全面等于 GPT-5.5 xhigh。
Google效率价值与成熟流程核验 2026-08-15
Gemini 3.7 Flash
高速多模态理解、Google 搜索与地图工具、长流程代理、高频编程循环和金融研究
AA v4.2 high 45;保留效率价值与成熟流程。新长程工程及多文件任务优先与 Gemini 3.8 做同任务比较。
AA v4.2:45 · high · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- medium
- API 输入
- $0.75 / M
- API 输出
- $3.75 / M
- 开放权重
- 否
- 判断把握
- 中高
高速与工具生态要和长程成功率分开看
Gemini 3.7 Flash 相当于哪个常用档位
一句话:3.8 已发布并有更强的同版本代码证据,3.7 仍可保留给效率优先与已有稳定流程。当前 AA v4.2 为 45,DeepSWE 最佳展示是 medium 65%±3;旧 high 65%±2 不再当当前记录。在需要自己找文件、补齐需求的 Cursor 任务里,它和 Luna max、K3 max、Sol medium 同一中间带,成本更低;遇到难规划和深审查,不要仅凭这条榜单替代强模型。
它比 Terra 和 Grok 的输入更便宜、输出也低于 Grok,但仍贵于 Luna。2027 年价格翻倍,因此长期产品不能只按当前优惠价做预算。
适合把它作为有 Google 工具和多模态输入的金融研究候选;专项领先不等于法律、代码和所有日常任务都同样领先。
高频开发、网页与 UI、多模态资料、Google 搜索 / 地图 / Workspace 工具优先试 high;先让 Opus / Sol 写清复杂计划,再交给 Gemini 执行,通常比让它独立承担高风险架构更稳。
当前 AA v4.2 已有 45 分,不再称缺综合分。3.7 的历史与效率用途继续保留,但不继承 3.8 新成绩,也不把旧版本专题当最新旗舰选择。
证据快照:2026-09-05 · 旧版本仍可用
集中查看
这个模型的主要判断
AA v4.2 high 45;保留效率价值与成熟流程。新长程工程及多文件任务优先与 Gemini 3.8 做同任务比较。
DeepSWE 当前最佳 medium 65%±3%;CursorBench high 61.6%。最佳已测档不总是 highest effort;3.8 的新成绩不继承给 3.7。
两种独立代码方法已满足正式收录门槛,但发布仍新、工具调用可能偏冗长;搜索、地图、缓存存储和 2027 年后的价格要分别核算。
2026-08-13 发布;Gemini API、AI Studio、Antigravity 与 Android Studio 已提供
官方介绍价至 2026-12-31;2027-01-01 起输入 / 输出 / 缓存升至 $1.50 / $7.50 / $0.15
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。