模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Google上一代多模态基线核验 2026-07-23

Gemini 3.5 Flash

复现基于 Gemini 3.5 Flash 的旧测试、价格快照与工作流

已有跨来源证据

AA v4.2 high 42(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

AA v4.242 · high · 估算,等待独立评测 · 核验 2026-09-05

上下文
1M
默认推理
medium
API 输入
$1.50 / M
API 输出
$9 / M
开放权重
判断把握
中高

集中查看

这个模型的主要判断

综合能力

AA v4.2 high 42(估算);当前方法下尚非完整独立实测,只作历史或专项参考。

实际编程

官方 Terminal-Bench 2.1 为 76.2%;独立综合位置低于 Opus 5 / Sol / Fable,但代理循环速度很有优势

使用限制

保留历史基线;新项目优先评估 Gemini 3.8/3.7,估算综合分不等于重新实测。

当前状态

已先后由 Gemini 3.6、3.7 Flash 接替;保留用于复现旧结论