这是同版综合指数的邻近参照,不是工程通过率。9 月 2 日文章中的旧 v4.1.1 分数不能拿来和当前 47 比能力下降。
Google高性价比多模态执行核验 2026-09-05
Gemini 3.8 Flash
多模态资料、Google 工具、有验收的多文件开发和长程代码执行
AA v4.2 high 47,邻近 Sol medium 46 / high 48;原创长程工程和 Cursor 多文件任务的相对表现更突出,不能只按综合分选代码模型。
AA v4.2:47 · high · 原页未标估算 · 核验 2026-09-05
- 上下文
- 1M
- 默认推理
- high
- API 输入
- $0.75 / M
- API 输出
- $3.75 / M
- 开放权重
- 否
- 判断把握
- 中高
从实际任务看
这款模型擅长哪些具体工作
以下结论来自全站同一份任务数据;点击后可查看首选、替代方案、组合流程和证据限制。DeepSWE high 74%±1、约 $2.36 / 题,进入同一领先区间;输出量和步骤较多。
较强:同口径仓库任务 · 判断把握 高工具入口联网检索与带引用报告官方 Gemini 工具与多模态入口完整,适合广泛收集;检索权限仍看具体产品。
工具优先:不能由基础模型总分决定 · 判断把握 中高多模态候选超长资料、PDF 与多模态理解官方文本、图片、音频、视频和 PDF 工作流完整;长任务可能使用更多 token。
中高:官方模态规格 + 综合任务 · 判断把握 中高工具生态候选表格、PPT 与 Office 成品Google 文件、搜索和代码执行生态完整,适合数据与文档工作流;以产品实际支持为准。
工具优先:不设纯模型冠军 · 判断把握 中原生工具候选浏览器操作与联网代理可接入 Gemini 工具生态,浏览器操作还取决于入口支持、权限和验证机制。
工具优先:模型与工作台共同决定 · 判断把握 中高低价强工程候选低成本批处理与规模化调用DeepSWE high 74%±1、$2.36 / 题,CursorBench high 69.2%;步骤多,不能只看单价。
中高:价格、独立综合分、长程任务与早期实测 · 判断把握 中高两种独立代码方法,仍不是所有任务通吃
Gemini 3.8 Flash 为什么值得试代码执行
它的综合分接近 Sol medium—high,但在 DeepSWE 和 CursorBench 两种代码任务中更突出,已经具备正式执行候选的证据。低单题费用不等于每个项目都更快,3.7 的效率优先流程也不必无条件替换。113 个任务、同一代理框架,区间重叠支持同一领先档;但约 143K 输出与 166 步说明它可能走得更长。费用是每题平均,不是含返工的成功任务成本。
第二种任务方法也支持较强代码执行与成本价值;1 个百分点左右不制造稳定冠军。它不是沿用 3.7 的榜分,也不是仅靠 Google 自报。
当前专业任务点位相邻但误差重叠;综合指数、代码通过率与这项经济任务权重不能相加。Vals 页仍列 2027 标准单价,不把该页费用当当前介绍价账单。
Gemini API、AI Studio 和 Antigravity 可用;音频、缓存存储与工具另按项目计费。3.8 Flash Cyber 属受限防守项目,不等于普通 Flash 具有相同权限。
多模态资料、Google 工具和有自动验收的多文件实现可先试 high;与现有 Sol / Gemini 3.7 同题记录通过率、耗时、步骤和账单。高风险规划及发布终审继续保留独立复核。
两种独立代码方法支持收录,但尚无本站长期生产稳定性记录。3.8 可能使用更多 token;不要把更高能力、输出速率、总任务耗时和费用合成一个“更快更省”的保证。
证据快照:2026-09-05 · 发布 2026-09-02
集中查看
这个模型的主要判断
AA v4.2 high 47,邻近 Sol medium 46 / high 48;原创长程工程和 Cursor 多文件任务的相对表现更突出,不能只按综合分选代码模型。
DeepSWE high 74%±1 / $2.36;CursorBench high 69.2% / $2.38,已有两种方法支持代码执行价值。
生成与工具步骤可能较多;低单题费用不代表等待更短。3.8 Flash Cyber 为受限专用版本,不继承为普通 Flash 的权限或成绩。
已有跨来源证据,最近核验 2026-09-05
2026 年底前介绍价;音频输入、缓存、工具和后续标准价按官方对应项目计费。
本页的关键来源
官方来源确认型号、规格与可用性;独立来源只回答各自测试覆盖的问题。