模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

不做“工具大全”

只放在具体任务上真正值得先试的工具

只推荐某项任务上效果领先,或达到可用线后明显更省的工具;其余继续观察。

长期推荐门槛

最强与最省,只能在达到基础线以后比较

质量底线按任务单独定义,不用一个总分横跨研究、编程、视频和办公。
01

效果领先

同一任务轨道中位于第 1,或 95% 区间与领先者重叠;仍需保留样本量、日期、版本和方法。

02

达标更省

先通过该任务的可用质量底线,再比较单次费用、失败重试、人工返工和成功任务成本。

03

入口独特

只有原生数据、工具权限或工作流确实不可替代时,才按产品优势推荐,不能伪装成模型智力结论。

04

其余只观察

证据不足、购买路径不清、样本太少或未过质量线的模型继续调研,但不进入用户推荐。

先把“视频第一”拆开

先说清手里有什么,以及最后要什么

文生视频、图生视频、修改已有画面、把中文换成英语和制作字幕是五种不同任务;不能把一个“视频第一”套到全部任务。
01 · 只写一段文字

文生视频

“夜晚的海边,一辆车驶过,带环境声。”

新控制先试 Omni 1.1;低价候选看 fal H3 Max
02 · 先给一张图片

图生视频

让人物照片自然转头,或让产品图变成运镜广告。

效果看原版 H3;低价快速生成看 fal H3 Max
03 · 上传一段已有视频

视频编辑(带声音)

换主体、改动作或风格、续写镜头,同时检查声音是否同步。

效果优先试 Wan 3.0;已有 Omni 流程作成本对照
04 · 已有中文人物视频

换成英语等其他语言

希望声音仍像本人;如果人物出镜,还要决定嘴型是否必须同步。

嘴型要同步选 HeyGen;只换声音选 ElevenLabs
05 · 已有视频或音频

双语 / 多语言字幕

自动识别中文,生成中英双语字幕,或导出其他语言的 SRT。

省心选剪映 / CapCut;免费可控选 Subtitle Edit
为什么你会记得 Seedance / 即梦曾经是第一

2026-06-29 的 Arena 直接编辑榜里,Seedance 2.0 确实是第 1,当时还没有 H3。本站 7 月快照采用另一张滚动榜,当时领先的是 HappyHorse 与 Wan。

截至 2026-09-05,AA 有声编辑由 Wan 3.0 领先,图生则由 fal 后训练的 H3 Max 领先;Arena 的图生领先者是原版 H3。日期、候选覆盖和任务定义不同,不能把其中一张榜写成永久总冠军。

Seedance 2.5 现在已有 Arena 同版本结果:文生和图生与 2.0 几乎同点,编辑进入宽误差的领先区间。新版可以试,但旧版分数仍不能直接继承。

Seedance 2.5 实际入口

普通创作与 API 接入,先选对入口

这不是两个模型的质量排名,而是同一个 Seedance 2.5 的两种使用方式。入口、地区、计费和工作流不同,不能只看模型名。
01 · 普通创作者优先核对

Dreamina / 即梦生态

适合谁
想用可视化编辑器上传图片、视频和音频参考,并在同一创作流程里继续修改的人。
成本怎么看
价格与可用额度按地区、账号和套餐显示;先在模型选择器确认自己的账号是否已经出现 Seedance 2.5,再决定购买。
先注意
官方专题页上线不等于所有地区和账号都已全量开放;页面或 App 仍显示 2.0 时,不要把生成结果写成 2.5。
02 · 开发者与按量试验

fal.ai Seedance 2.5 API

适合谁
需要把文生、图生或多参考视频接入自己的流程,并希望在生成前看清按量价格的人。
成本怎么看
fal 当前估算 480p / 720p / 1080p 约 US$0.221 / US$0.473 / US$1.164 每秒;实际按画面尺寸、时长和视频输入的 token 公式计费,不把近似秒价当固定套餐。
先注意
这是 fal.ai 当前接口价,不是字节统一零售价,也不能与不同平台、分辨率和设置的 Gemini / H3 分钟价硬比;重试、延长、视频参考输入时长与人工返工都要另算。
有了 Seedance 2.5 独立结果,为什么还要按任务试

Arena 已分别测试 2.5 的文生、图生与编辑,Megaton 也发布了专业评审。结果支持它成为可认真试用的候选,不支持把三类任务合成一个总冠军。

长达 30 秒、多参考和视频延长是否值得更高费用,要用你的素材比较成片成功率、声音、连续性和返工;已有稳定的 2.0 流程不必只因版本号立刻迁移。

当前已核验结论

每条赛道单独给效果、成本与边界

各条目显示自己的核验日期;图像、视频与 TTS 更新至 2026-09-05。单榜阶段性结果与多来源信号分开,滚动榜变化不等于模型突然“降智”。
01 · X 实时信息调研

Grok / X 是原生信息入口,不是免核验答案机

效果 / 入口首选

原生入口:Grok 4.6 Search + X 原帖

达标后的价值选择

低频先用免费 Grok;只有 X 原帖发现率或 Build 持续产生独特价值、共享周额度又撞限时才付费。

证据

xAI 官方说明 Grok 可实时搜索网页与 X;付费产品共享一个周额度池。AA、Vals、CursorBench 与 DeepSWE 支持 4.6 进入低价前沿,但不证明每条搜索结论都正确。

02 · 图像生成与单图编辑

效果先试 GPT Image 2;低价选择先验证同题质量

效果 / 入口首选

GPT Image 2:AA 的 high 档与 Arena 的 medium 档仍分别位于文生图第 1;两个质量档和价格不能混用。

达标后的价值选择

暂不设正式低价第二选择。Reve 2.1 当前 AA 估算约 US$200 / 千张,不再支持旧的 US$24 / 千张低价结论;不要拿旧型号或不同质量档的价格代替。

证据

AA 文生图:GPT Image 2 high 为 1177±10;Arena 文生图:medium 为 1382±4。MAI-Image-2.6 已在两家榜进入第 2,但预览入口、官方计价与成功任务成本仍需单独核对。

03 · 文字转语音(TTS)

单榜效果先试 Sonic 3.6;低价候选保留 Simba 3.2

效果 / 入口首选

Cartesia Sonic 3.6:AA 原生音色盲测当前第 1,1282±17、1,790 个样本。先试目标语言与角色,不能把总平均分当中文配音保证。

达标后的价值选择

Speechify Simba 3.2:当前 1240±14、2,383 个样本,和 Qwen Audio 3.0 Plus 的 1241±14 同档。官方 Starter 为 US$10 / 月含 100 万字符,超出约 US$10 / 百万字符;质量达标后再比较返工。

证据

这是一个独立偏好方法下的阶段性选择。Cartesia 的 Pro 为 US$5 / 月含 10 万 credits 并含商业许可;credits、字符与套餐额度不同,不能仅按月费判断谁更便宜。

04 · 文生有声视频

新控制能力先试 Omni 1.1;便宜生成候选看 fal H3 Max

效果 / 入口首选

Gemini Omni 1.1 Flash:Arena 文生视频为 1515±15、1,777 票,处于领先区间;Flow 与正式 API 已提供首尾帧、场景延长和高分辨率上采样。

达标后的价值选择

fal 后训练的 MiniMax H3 Max:AA 有声文生 1235±10、5,417 个样本,处于该榜领先区间。fal 官方指南列 768p 约 US$0.08 / 秒(US$4.80 / 分钟),先做可用成片成本试验。

证据

1.1 的 Arena 成绩与 H3 Max 的 AA 成绩来自不同榜,不能比较 Elo 大小。AA 仍测试旧 Omni Flash,不能把旧版分数继承给 1.1;以上均保留单榜阶段性边界。

05 · 图生有声视频

原版 H3 看效果;fal H3 Max 看低价快速生成

效果 / 入口首选

MiniMax H3 原版:Arena 图生视频当前 1497±6、36,137 票,进入领先区间;需要原版参考控制和 2K 输出时先试它。

达标后的价值选择

fal H3 Max:AA 有声图生为 1201±9、5,497 个样本,当前合理名次第 1;768p 官方指南价约 US$4.80 / 分钟,可作更便宜的试测候选。

证据

不同榜支持不同模型,暂不宣布跨平台唯一冠军。Seedance 2.5 已有 Arena 图生 1478±10,与 2.0 的 1477±8 几乎同点;新版不是自动更优,原有 2.0 流程不必只因版本号立即迁移。

06 · 修改已有视频(同时评声音)

编辑效果优先试 Wan 3.0;低价保留 Omni 试测路线

效果 / 入口首选

Wan 3.0:AA 有声编辑 1190±7、5,293 个样本;Arena 编辑 1414±26、463 票,和 Seedance 2.5 的区间重叠。两家偏好榜支持优先试用,不代表所有镜头唯一最好。

达标后的价值选择

已有 Gemini Omni Flash 流程可继续作低价候选:AA 编辑 1125±5;官方 720p 视频输出约 US$0.10 / 秒,输入另算。升级 1.1 可获得新控制,但不继承旧版编辑分数。

证据

Wan 3.0 Standard 国际端点 list 为 720p US$0.10 / 秒、1080p US$0.20 / 秒,输入与输出视频时长均计费;当前限时 30% 折扣到 2026-09-24 00:00(UTC+8)。更便宜不等于同画质或同成片成功率。

07 · 跨语言视频翻译(保留说话人感觉)

要同步嘴型选 HeyGen;只换声音选 ElevenLabs 更省

效果 / 入口首选

人物正脸出镜、英语成片也要像本人在说:先试 HeyGen Video Translation。它会翻译语音、尽量保留原说话人音色,并调整嘴型;复杂侧脸、遮挡或多人镜头优先 Precision。

达标后的价值选择

嘴型不重要、重点是声音和节奏相近:先试 ElevenLabs Dubbing。它可分离多位说话人和背景声,官方 API v1 约 US$0.33 / 分钟(带水印)或 US$0.50 / 分钟(无水印),但明确不提供嘴型同步。

证据

HeyGen 官方 API 的 Speed / Precision 视频翻译约 US$2 / US$4 每分钟;ElevenLabs 官方文档说明 Dubbing 保留语气、节奏和情绪,支持 90 多种语言。二者解决的问题不同,因此这是场景分流,不是同一盲测的绝对排名。

08 · 双语与多语言字幕

省心选剪映 / CapCut;免费可控选 Subtitle Edit

效果 / 入口首选

普通用户先试剪映 / CapCut:自动识别后可一键生成双语字幕,并继续在同一时间线校对、排版和导出,适合中文视频快速做中英版本。

达标后的价值选择

不想为字幕软件付费、需要 SRT 等标准文件:用 Subtitle Edit + 本地 Whisper。它免费开源,支持语音识别、翻译、双语模式、波形校时和多种字幕格式。

证据

两项结论来自产品功能与工作流,不是统一准确率榜。CapCut 的优势是上手和剪辑一体化;Subtitle Edit 的优势是免费、文件可控和本地识别。

新品先观察

发布了,不等于已经证明最好

先告诉你哪里能试、官方声称改了什么,再把仍缺的价格与独立证据写清楚。
视频生成与编辑 · 新品观察

Seedance 2.5 已有独立结果,仍需按任务判断升级价值

现在能不能用

字节官方模型页已提供 Try Now;fal.ai 已上线文生、图生和多参考三个 2.5 API 端点。单次最长 30 秒,并可继续延长两次;Dreamina / 即梦侧仍需以账号实际模型选择器为准。

官方新增信号

厂商称 2.5 改善长叙事、参考视频理解和音视频编辑,并加入白模控制、绿幕编辑、专业运镜与表演调度。

为什么暂不推荐

Arena 已有同版本文生 1482±12、图生 1478±10、编辑 1410±26;前两项与 2.0 几乎同点,编辑样本仍少。Megaton 也给出专业盲评,但不同方法和付费报告边界不能拼成全视频冠军。

下一次怎么转正

需要 30 秒叙事、多参考或视频编辑时可以试 2.5;用同一组中文对白与人物镜头比较可用成片率、延长连续性、输入视频费用和人工返工,再决定是否替换 2.0 流程。

开发代理 · 新品观察

Muse Spark 1.3 已发布,公共档与限量预览必须分开

现在能不能用

2026-09-02 已在 Muse Code 与 Meta Model API 发布。AA 将 xhigh 标为当前公共版本、max 标为限量预览;以账号实际可用档为准,不把预览成绩当普通入口表现。

官方新增信号

Meta 称 1.3 改善长程代码、多任务协作和指令保持;自家工程师对照中的工具与 token 节省是厂商测试,不能外推到每个项目。

为什么暂不推荐

1.3 已有 AA 独立信号,但厂商公开的 DeepSWE 结果是 Meta 自跑。1.2 的专业任务与工程分数不能继承给 1.3,暂不据此宣布它是通用开发代理首选。

下一次怎么转正

先确认实际模型和推理档,再补同版本真实仓库与第二种独立工程方法;同时核对 max 的公开可用性与价格。旧 1.2 专项证据仍可用于原版本对照。

图像生成与编辑 · 新品观察

Qwen Image 3.0 已补齐 API 与文生图证据,仍非效果首选

现在能不能用

官方已列 qwen-image-3.0 与 qwen-image-3.0-pro。国际端点标准版输出约 US$0.03 / 张;Pro 的 1K / 2K 输出约 US$0.04 / US$0.075,输入图片另计。

官方新增信号

厂商发布称 3.0 可理解最长约 4.5K token 指令,改善密集布局、最小约 10px 文字、12 种语言文本与界面生成;这些是官方能力声明,不是独立盲测结果。

为什么暂不推荐

Pro 的 AA 文生图为 1086±11、Arena 为 1254±7,两家榜都有同版本结果,但都没有进入效果最前列;便宜也不等于已通过中文排版和编辑一致性的质量底线。

下一次怎么转正

适合已有阿里云入口或重点做中文海报的人试测。把标准版与 Pro 分开,用同一组文字、界面、海报和局部编辑题比较成功率;不要继承 2.0 的编辑成绩。

图像生成与编辑 · 价值观察

MAI-Image-2.6 两榜前列,但先核对预览权限与计价

现在能不能用

Microsoft 官方已提供 MAI Playground 与 Foundry 预览入口;2.6 和更快的 2.6 Flash 是不同型号,实际可用性以账号、区域与配额为准。

官方新增信号

官方称 2.6 改善文字、人像和商业图像;Foundry 文档列文字生成与图片编辑。产品特性不能代替生成质量与许可核验。

为什么暂不推荐

2.6 在 AA 和 Arena 文生图都排第 2;AA 的约 US$38.9 / 千张只是平台估算。本页尚无完整核实的官方计价与同题成功成本,不将它直接写成正式低价冠军。

下一次怎么转正

先在自己的账号确认 2.6 型号、预览条件和实际收费,再与 GPT Image 2 用同一批真实素材比较文字正确率、编辑保持与重试成本;2.6 Flash 不继承 2.6 分数。

继续调研但暂不推荐

推荐榜只放少数达标工具,候选范围可以更广

图像生成 / 编辑、文字转语音、三类带声音视频、跨语言视频翻译和字幕工作流已有阶段性结论;Seedance 2.5、Qwen Image 3.0 已补上独立结果,但是否值得替换现有流程仍看任务。Muse Spark 1.3 与 MAI-Image-2.6 的部分准入条件仍需核对。音乐、语音识别、办公交付、电脑代理和企业安全继续调研。

每个候选都要先确认对象类型、官方入口、地区、价格、版本、独立证据、质量底线和失败成本;没有通过就保持“观察”,不进入推荐卡。

查看模型状态观测方法