模型决策报告2026 前沿模型指南

像提问一样搜索

你想完成什么,或卡在哪里?

不需要知道模型名,直接说任务或疑问

先给你最可能有用的入口;需要原文细节时,再继续显示正文中的对应段落。

EN第 1.36.1 版 · 构建 2329c88v1.36.1
更多目录

Moonshot通用旗舰 · 新发布核验 2026-08-15

Kimi K3

网页与 React 原型、长资料、并行调研、图片 / 视频理解、长程 Agent,以及具备大型推理基础设施的开放权重部署

先说结论

AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。

AA v4.250 · max · 原页未标估算 · 核验 2026-09-05

本站旗舰轨道开放权重与长任务强档
中等置信度具体顺序随任务与榜单变化
为什么只给区间,不写唯一名次

当前 AA v4.2:K3 50、Sol max 51、Astra max 55、Fable 5.1 max 57(含回退)。DeepSWE 的 K3 max 69%±5 与多款强模型区间重叠。旧 AA v4.1.1 的 60 和 8 月 Vals 排名保留为历史,不拿来比较新型号。

一次能放多少资料上下文窗口
约 100 万 token
开发者 API 思考档默认 max;Code 默认 high
low / high / max
开发者 API 输入
$3 / M
开发者 API 输出
$15 / M
能否自行部署
Kimi K3 License(商业使用有条件)
本站判断把握
中高

60 秒看懂

先判断 K3 是否适合你

先读白话结论就能做决定;每张卡片最后一行保留同一结论的专业口径,方便开发者继续核对。
01 · 适合谁

想做网页、复杂资料或并行调研的人

K3 的突出点不是“什么都第一”,而是能把网页与 React 原型、长资料、图片 / 视频理解和多步骤 Agent 任务放在同一套产品里完成。

专业口径:1M 上下文、多模态输入、WebDev / React 早期领先,并提供 K3 集群与动态工具能力。
02 · 怎么开始

先用免费入口验证,再按功能门槛付费

只是聊天先用免费版;要在 Kimi Code 使用 K3 或需要 Agent 集群,再看 ¥99 档。日常编程选 k3-256k + high;只有资料真的很长、需要 Kimi Claw 或 1M K3 才看 ¥199 档。

专业口径:Moderato 是 K3 Code / Agent 集群起点;k3-256k 与 1M k3 在 256K 内结果相同,官方称 1M 版本约耗两倍 Code 额度。Allegretto 才开放 Claw、最高 1M 与 20× Code 额度。
03 · 什么时候别硬用

事实必须准确、追求低延迟或只用普通电脑时

重要事实要回到原始来源核对;短任务不必开更耗额度的集群。K3 虽然已经能下载,但完整文件约 1.42 TiB,普通个人电脑并不适合直接部署。

专业口径:AA 记录事实性风险;API 已支持 low / high / max,但默认 max。完整权重、技术报告与自部署说明已发布,许可证为带商业条件的 Kimi K3 License,不是 MIT。
看不懂 Agent、1M、max 或 API?展开 7 个常见词的白话解释
Agent
不只是回答一句话,而是会搜索、读文件、运行工具并分步骤完成任务。
K3 集群
让多个子智能体并行分工,适合大规模搜索和批处理;任务小的时候更耗额度,不一定更划算。
1M 上下文
一次能放入约 100 万 token 的资料;容量大不等于每一处都能准确记住,关键事实仍要复核。
low / high / max
思考强度档位。越高通常越慢、越耗额度;Kimi Code 默认 high,开放平台 API 默认 max,两边现在都支持 low / high / max。
k3-256k
Kimi Code 的日常省额度版本。在 256K 以内与 1M k3 使用同一 K3 模型,官方称结果相同,而 1M 版本约耗两倍额度;它不支持视频输入。
API
给开发者把模型接进自己产品的接口,按输入与输出 token 计费,不等于 Kimi 会员。
开放权重
模型文件已经可以下载和自行部署,但不代表普通电脑能跑,也不等于没有商业许可条件。K3 完整权重约 1.42 TiB。

普通 K3、集群与 1M 怎么选

先看任务能不能真正并行,再决定是否多花额度

这里把官方计费与速度口径、编程项目质量、1M 上下文和社区实测分开说明;没有把厂商速度数字写成质量或额度保证。
一条判断题先问:这个任务能否拆成至少 3 条彼此不等待、每条都有独立交付物的支线?不能就用普通 K3;能拆开,而且省下的等待时间值得多花额度,再开集群。
大多数任务的默认选择

普通 K3 / 单 Agent

目标连贯、步骤互相依赖,需要你边看边改

编程任务
修一个 Bug、改共享核心文件、实现一个功能、连续调试或小到中型仓库,优先在 Kimi Code 中用普通 K3。它更容易保持同一套假设,也方便随时停下检查。
其他任务
普通问答、少量资料调研、单份长文、一次分析或需要逐轮确认方向的工作。
切换边界
只有当资料、模块或子问题多到可以真正并行,而且单 Agent 的等待时间已经成为瓶颈时,才需要离开这个默认选项。
大规模并行任务的加速器

K3 集群 / Agent Swarm

支线相互独立,可以同时搜索、实现、审查再汇总

编程任务
适合全仓库按模块审计、多个边界清楚的组件并行实现、多组测试 / 文档 / 代码审查同时推进,或接口已经约定好的多模块迁移。不适合多个子 Agent 同时争改同一核心文件。
其他任务
适合大规模搜索、批量下载、100 份以上文档宽读、多地区或多主题交叉调研,以及章节能独立撰写的超长报告。
切换边界
需求还模糊、额度余量不足、必须频繁和人来回确认,或任务只有一条关键推理链时,不要为了“更强”开集群。
App 里的“约 3 倍”怎么读

不是只把同一份额度扣快 3 倍:多个子 Agent 的实际 Token 会一起计入任务总消耗

01 · 实际计费

Kimi 官方说明,Agent 按实际 Token 消耗 credits;集群通常会消耗普通 Agent 的数倍,具体取决于任务复杂度和子 Agent 数量。公开帮助页没有承诺一个固定的 3× 公式,因此 App 中的“约 3 倍”更适合当作使用前估算,而不是结算保证。

02 · 速度指标

官方另一个 3—4.5× 指标说的是大规模搜索中的最少关键步骤和实际完成时间最多缩短到约 1/3—1/4.5,并不是额度倍率。速度变快与总 Token 变多可以同时发生。

03 · 不要混淆

Kimi Code 文档里“约 6× 输出速度、约 3× 额度”明确属于 K2.7 HighSpeed,是另一个功能,不能拿来证明 K3 集群固定扣 3 倍。

怎么实测:判断划不划算要看任务结束后的总 credits、成功率和返工,而不是只看每分钟掉得多快。第一次先用一小块真实任务对照普通模式,确认并行确实节省等待或增加覆盖,再扩大。

项目质量

集群提高的是分工能力,不是把单个模型的智力乘几倍

项目越能按独立模块、测试或资料组拆开,集群越可能有收益;共享状态和串行依赖越多,合并风险越大。

更可能提升覆盖面、并行速度与独立复核

不同子 Agent 可以分别查来源、读模块、跑测试和做审查,减少一条上下文里互相挤占信息;任务越可拆分,收益越明显。

不会自动提升单条推理链的深度与最终一致性

多个 Agent 不等于同一个 Agent 的智力变成数倍。最终质量仍取决于任务拆分、共享约束、验收标准和主 Agent 的合并能力。

可能反而变差共享核心、模糊需求与合并冲突

如果子任务互相等待、同时修改同一文件或各自采用不同假设,重复工作、接口冲突和遗漏会抵消并行收益。当前也没有找到 K3 普通与集群在同一真实项目上的独立受控质量对照。

100 万上下文

日常先用 k3-256k;1M 是容量开关,不是质量加强档

这些情况再开
  • 需要一次保留大量跨文件关系:超大仓库、多轮终端记录、几十到上百份长文档,或资料已经接近 / 超过 256K。
  • 压缩或只挑文件会丢掉关键的全局关系,而且你确实要在同一会话中跨章节、跨模块追踪引用与约束。
  • 任务允许较高的读取成本和更长等待,并且已经准备好目录、文件索引、验收清单与关键事实定位。
这些情况先别开
  • 单个 Bug、少量文件、普通问答、短文写作,或只需从大仓库里挑出几个相关文件。
  • 把整个仓库、重复日志和无关资料一次性塞进去,只是为了省去筛选;更多上下文也可能稀释真正重要的线索。
  • 额度或 5 小时窗口紧张;官方称 1M k3 在 Kimi Code 中约消耗 k3-256k 的两倍额度。
  1. 01

    日常问答、补全、常规功能和少量文件先选 k3-256k + high;只有发现压缩会破坏全局关系再升 1M。

  2. 02

    先给资料做目录和优先级,明确哪些是事实来源、哪些只是背景,不把 1M 当作无差别文件箱。

  3. 03

    从 1M 切到 256K 前先手动 compact;若历史已超过 256K或含视频,工具会压缩或切换失败。反向从 256K 升 1M,当前版本可直接切且不影响缓存。

  4. 04

    会话内保持同一模型和推理档;切换 effort 会使缓存失效,需要换档时更适合新开会话。

  5. 05

    Kimi Code:Moderato 可用 k3-256k,并可使用 k3 到 256K;Allegretto 及以上才可把 k3 用到最高 1M。

社区与技术论坛展开 3 组真实用量信号与样本边界用于发现风险,不换算成固定倍率

真实用户普遍把集群留给少数“大而可并行”任务

一名 Allegretto 用户称普通研究 / 写作集群任务约消耗池子的 5%—10%,因此每月只在真正并行的任务上用 1—2 次;这是单一套餐与工作流经验,不能外推成固定比例。

Reddit Agent Swarm 用量复盘

同一任务的消耗会被代理框架和子 Agent 数明显放大

一个 LINUX DO 单一后端任务记录中,Kimi CLI / Work、带子 Agent 的第三方框架与 Claude Code 的用量差异很大;它说明 harness 会改变总消耗,不能只按基础模型名估算。

LINUX DO 同任务多工具记录

1M 与重度集群都出现过单次任务挤压额度窗口的报告

V2EX 和 Reddit 各有单一用户报告半小时集群消耗约四分之一月额度、1M 会话接近用完 5 小时窗口,或一天重度集群用掉超过半周额度。样本不可比,只能作为先做小样本的风险提示。

V2EX K3 集群与 1M 体验

给需要核对规格的人

官方已经确认了哪些技术事实

普通用户读完上面的 60 秒结论就可以继续选任务或套餐;开发者可在这里展开产品、API 与 Kimi Code 的完整规格。
开发者规格层展开 19 条官方事实型号、架构、上下文、价格、推理档、缓存、权重状态
01

官方 API 型号为 kimi-k3,已可通过 Chat Completions 调用。

02

总参数 2.8T,使用 Kimi Delta Attention 与 Attention Residuals;官方 API 已明确支持图片与视频输入。

03

上下文为 1,048,576 token(约 100 万 token);缓存命中 / 普通输入 / 输出价格为 $0.30 / $3 / $15。

04

产品口径必须分开:开放平台 API 的 kimi-k3 始终思考,现已支持 reasoning_effort=low / high / max,默认 max;Kimi Code 的 k3 与 k3-256k 也支持三档,但默认 high。

05

单次生成默认上限为 131,072 token,可设置到 1,048,576 token;temperature、top_p 等采样参数目前固定。

06

API 支持严格 JSON Schema、tool_choice、动态工具加载和自动缓存;这些是集成能力,不等于所有代理工作台都已有相同体验。

07

Kimi Code 已新增 k3-256k:在 256K 内与 k3 使用同一 K3 模型且官方称结果相同,1M k3 约消耗两倍额度;k3-256k 不支持视频输入。

08

Kimi Code 的 k3 与 k3-256k 从 Moderato 起可用;Moderato 的 k3 最高 256K,Allegretto 及以上才可使用最高 1M。两者默认 high,关闭思考会路由到 K2.6,并不是非思考版 K3。

09

切换模型或 reasoning effort 都会使现有上下文缓存失效;官方建议选定档位后保持会话内一致,真正需要切换时新建会话。

10

Moonshot 已于 2026 年 7 月 27 日在官方 GitHub 与 Hugging Face 发布完整 K3 权重、技术报告、自部署说明和 Kimi K3 License;因此 K3 现在可以自行部署,但应准确写成“开放权重”,不把自定义许可证简化成 MIT 或无条件开源。

11

截至 2026 年 7 月 31 日,官方 Hugging Face 仓库包含 96 个 safetensors 分片,权重文件合计约 1.42 TiB。这个数字说明它需要大型存储与推理基础设施,不等于官方给出了某种固定 GPU 最低配置。

12

Kimi K3 License 允许使用、修改、部署和衍生开发,但大型 Model-as-a-Service 商业业务和达到指定规模的商业产品有额外协议或显著标识要求;内部使用及官方或认证推理伙伴另有例外。商业部署前应直接核对许可证原文。

13

API 和 Kimi Code 现在都有 low / high / max,但默认值不同:API 默认 max,Code 默认 high。官方同时承认 K3 对思考历史敏感、可能过度主动。

14

Kimi 网页与 App 已把 K3 和 K3 集群分别列为 Low / High / Max:普通 K3 面向 Chat 与 Agent,K3 集群面向大规模搜索和批处理;K2.6 不消耗 credits,K3 与 K3 集群会消耗。

15

K3 网页产品内置 Web Search、Fetch、Image Search、IPython 与 Memory;Kimi Agent 可完成研究、文档、表格、PPT 和网站任务。官方称 K3 集群最多可调度 300 个子智能体、单次超过 4,000 次工具调用,但仍是 Beta 且额度消耗较高。

16

Kimi Websites 是 K3 驱动的全栈建站产品,可从自然语言、截图或录屏生成前后端,并提供数据库、登录鉴权、版本管理、在线预览、部署与代码导出;这是 Kimi 产品能力,不等于裸 API 自动包含整套建站环境。

17

Kimi Code 明确与 Kimi 综合会员共享同一额度:Code 每 7 天刷新,还有滚动 5 小时和月度总额度;所有登录设备与 API Key 共用。

18

Extra Usage 已上线:订阅额度用完后可按实际用量继续使用,网页与 Kimi Code 共用余额;订阅额度先扣,Extra Usage 最后兜底,可设置月度消费上限。

19

国内新用户赠送的 15 元代金券不能用于 K3;官方同时提示内置网页搜索正在更新,近期不建议用于生产流程。

中国区会员选择

先按用途选档,不要只看最高套餐

先记结论:这里比较的是中国大陆人民币套餐,不能与国际站混用。Kimi Code 已明确与会员共享同一额度,并同时受每 7 天刷新、滚动 5 小时和月度总额度限制;实际余额以订阅页与 Kimi Code 控制台为准。
30 秒决策

先看你必须用什么功能

从满足功能的最低档开始;没有命中明确门槛,就不要为“也许会用”提前买高档。

只聊天、偶尔问答Adagio 免费

K2.6 不消耗会员额度(credits);K3 与 K3 集群会消耗。先用免费入口确认回答风格和基础功能是否适合自己,不必急着付费。

轻量 Code、文档与研究Andante ¥49/月

Kimi Code 额度为 1×,适合低频尝试;但 Kimi Code 中不能使用 K3。

要 Agent 集群或 K3 编程Moderato ¥99/月

这是 Agent 集群和 Kimi Code 使用 K3 的最低档;日常编程可选更省额度的 k3-256k,或把 k3 用到最高 256K。

要 Kimi Claw 或 1M K3Allegretto ¥199/月

Kimi Claw 从这一档开放,同时解锁 K3 最高 1M 上下文和 20× Code 额度。

20× Code 仍明显不够Allegro ¥699/月

主要价值是 60× Code 和更高 Agent 用量;不会因此获得比 Allegretto 更强的 K3。

01先卡功能门槛

只聊天就免费;要 Agent 集群或 K3 编程从 ¥99 起;要 Kimi Claw 或 K3 最高 1M 从 ¥199 起。

02第一次只买一个月

官方当前套餐页未列出统一的付费档免费试用,开通后原则上不可退费。未确认长期使用前,不把年付折扣当成必省的钱。

03到期前复盘真实用量

在「设置 → 订阅」查看剩余额度、下次刷新时间和最近 1,000 条用量,记录 Kimi 实际替代了哪些现有工具。

04按消耗升、降或停

不够用可按剩余价值折算升级并立即生效;想降档则先取消续费,到期后再订低档,也可以直接不续。

浪费焦虑换成一道算术题日均成本 = 月费 ÷ 30

再用「预计闲置天数 × 日均成本」判断今天开通是否值得。

Andante
约 ¥1.6/天
¥49/月
Moderato
约 ¥3.3/天
¥99/月
Allegretto
约 ¥6.6/天
¥199/月
Allegro
约 ¥23.3/天
¥699/月
需要细看再展开查看五档完整权益与年付价格
先体验

Adagio

免费

无需年付

Agent
约 6 个 Agent 任务
编程
K3 编程权益未开放
数据库
专业数据库 200 次
适合
普通聊天和低风险试用
日常使用

Andante

¥49/月

¥468/年(省 ¥120)

Agent
约 30 个 Agent 任务
编程
Kimi Code 1×;不支持 K3
数据库
专业数据库 1,000 次
适合
文档、PPT、研究与轻量工作
K3 编程起点

Moderato

¥99/月

¥948/年(省 ¥240)

第一次用 K3 编程推荐从这里开始
Agent
约 60 个;Agent 集群起点
编程
Kimi Code 4×;K3 最高 256K
数据库
专业数据库 2,000 次
适合
经常编程,先验证 K3
专业使用

Allegretto

¥199/月

¥1,908/年(省 ¥480)

Agent
约 150 个;Agent 集群 50 次
编程
Kimi Code 20×;K3 最高 1M;支持 HighSpeed
数据库
专业数据库 5,000 次
适合
长项目、频繁编程与 Kimi Claw
重度高频

Allegro

¥699/月

¥6,708/年(省 ¥1,680)

Agent
约 360 个;4 个任务并行
编程
Kimi Code 60×;模型权限与 Allegretto 接近
数据库
专业数据库 12,000 次
适合
每天大量 Agent 与 Code 任务

年付只有在你已经确认长期使用时才更省;第一次购买仍建议先按月验证。

买之前必须知道
  • K2.6 不消耗会员额度(credits);K3、K3 集群与 Agent 类功能会消耗。Kimi Code 与会员共享同一额度,CLI、VS Code、第三方工具和所有登录设备也共用。
  • 官方给出的 Agent 任务数只是按常见 token 消耗换算的估计,不是保证次数;Kimi Code 同时有每 7 天刷新、滚动 5 小时和月度总额度。
  • 额度按计费周期刷新,未用完不会结转;官方当前套餐页未列出统一的付费档免费试用,虚拟服务开通后原则上不可退费。
  • Kimi Code 默认 high;日常先用 k3-256k。官方称 1M k3 约耗两倍额度;切换模型或推理档会使缓存失效,长会话中频繁切换也会放大消耗。
  • Extra Usage 只对订阅会员开放,订阅额度先扣、余额最后兜底;可以设置月度上限。它按实际内容和任务复杂度扣费,不保证整项任务能在余额耗尽前完成。
打开 Kimi 官方会员页核对最新价格 ↗
决策焦虑 FAQ

先把退路想清楚,再决定是否开通

这里回答“买错、浪费、忘记续费和已有其他会员怎么办”,不使用限售传闻制造紧迫感。

01还是不知道选哪档,最快怎么排除?

先只看功能门槛:只用 K2.6 可先从免费版开始;要 Agent 集群或在 Kimi Code 里用 K3,最低是 Moderato ¥99;要 Kimi Claw 或 K3 最高 1M,最低是 Allegretto ¥199。没有明确命中这些功能时,不必为了“可能会用”买更高档。

02担心以后买不到或不能升级,要不要现在先锁年包?

没有可靠证据支持因限售传闻提前锁定年包。当前官方规则允许在订阅页升级,并按剩余价值折算、当天生效;未来供应和规则没人能保证,购买当天再核对官方页,比为未证实的变化预付一年更稳妥。

03这几天没空用,开通是不是很亏?

先把情绪换成算术:月费 ÷ 30。Andante、Moderato、Allegretto、Allegro 分别约为 ¥1.6、¥3.3、¥6.6、¥23.3/天。用“闲置天数 × 日均成本”判断可接受损失,再决定今天开还是等真正要用时再开。

04怕忘记关自动续费,怎样把风险降到最低?

开通后即可在 Kimi「设置 → 订阅管理」或微信、支付宝、Apple ID 的自动扣款管理中取消续费;取消后当前周期权益仍保留到到期日。支付渠道是否提醒取决于你的通知设置,最好同时在扣款渠道复查一次。

05买错了怎么办?

付费虚拟服务原则上不可退费,但从低档升级会按剩余价值折算并立即生效;降档不能在周期中途完成,需要先取消续费,到期后再订低档。因此第一次从满足功能的最低档包月开始,通常比一步到位更稳。

06套餐额度用完,必须立刻升级吗?

不一定。可以等待每 7 天或月度额度恢复,也可给订阅账户开启 Extra Usage 按实际用量继续。先设月度消费上限;如果连续多周都靠 Extra Usage 补量,再比较升级套餐是否更便宜。Extra Usage 余额一般不可退,但不会过期。

07已经有 ChatGPT、Claude 或其他 AI 会员,还值得买吗?

先买一个月的最低可用档,并记录 Kimi 实际替代了哪些现有订阅用量:聊天、研究、Office、Agent 还是 Code。只有替代关系和额度消耗连续可见后,再决定长期保留、升级、转年付,或停掉其中一个订阅。

试用与退款

有 Adagio 免费档;官方套餐页未列出统一的付费试用,账号如出现活动试用须看清转正扣费规则;付费服务开通后原则上不可退费。

升级与降级

升级按剩余价值折算并立即生效;降级需取消续费,当前周期结束后再订低档。

取消续费

Kimi 设置、微信、支付宝或 Apple ID 均可管理;取消后权益保留至当前周期结束。

用量与发票

订阅页可看月度额度,Kimi Code 控制台或 /usage 可看 Code 与 Extra Usage;发票入口在「设置 → 订阅 → 账单 → 发票」。

软件与入口

聊天、Agent、建站、编程分别从对应入口开始

先按任务发生的位置选择产品:规模不大的任务不要为了“更强”直接开集群,代码仓库也不必绕回普通聊天界面。
01不必先下载桌面软件

快速聊天、联网研究与临时文件

Kimi 网页版或手机 App

适合随手问答、上传资料和使用云端 Agent。工作需要进入本地文件夹或持续运行时,再换 Kimi Work。

打开 Kimi
02先单 Agent,规模够大再开集群

深度研究、批量搜索与多份资料

Kimi Agent / K3 集群

K3 适合普通 Agent 任务;K3 集群面向大规模搜索和批处理,官方称最多可调度 300 个子智能体、单次超过 4,000 次工具调用。集群仍是 Beta 且更耗额度,小任务不必使用。

查看 Agent 集群
03全栈原型与视觉复刻入口

从描述、截图或录屏生成可部署网站

Kimi Websites

可生成前后端、数据库和登录鉴权,并提供版本、预览、部署与代码导出。先把它当作 Kimi 的托管建站产品测试,不把成品表现直接等同于裸 K3 API。

打开 Kimi Websites
04知识工作首选

本地文档、浏览器与定时工作流

Kimi Work

Windows 与 Apple 芯片 Mac 可用;能挂载本地文件夹、运行 Python / Shell、使用 WebBridge 操作网页并设置定时任务。K3 在具体账号或客户端中的可用性以模型选择器为准。

下载 Kimi Work
05新编程用户首选

代码仓库、终端与自动执行

Kimi Code CLI

体验最接近 Claude Code。新版 CLI 基于 Node.js,Windows、macOS 和 Linux 均可安装;运行 kimi 后用 /login 登录,无需手动管理 API Key。

查看 CLI 安装
06需要手动配置

继续使用熟悉的第三方编程工具

Kimi Code API

官方提供 OpenAI 与 Anthropic 兼容接口,可接入支持自定义模型的工具。Claude Code 用户可按官方指南接入;Codex 用户若只是想试 Kimi,先并行使用 Kimi CLI 更省事。

查看接入说明
已经使用 Codex / Claude Code?Kimi Code CLI(命令行编程工具)是最短迁移路径

如果你不使用终端,可以跳过这一段,继续使用 Kimi 网页、Agent 或 Websites。

  1. 01

    安装新版 Kimi Code CLI

  2. 02

    在终端运行 kimi

  3. 03

    输入 /login 登录

  4. 04

    /model 选择 K3 或 K2.7

新用户暂不建议把 VS Code 扩展作为第一入口:官方当前仍限制新版 TypeScript CLI 用户的新装资格。

产品组合对比

Kimi、ChatGPT 和 Claude 各自强在哪

这里比较会员能直接使用的产品组合,不把 API 单价、模型智力和客户端功能混成一个总分。

Kimi 会员 + Kimi Work / Code

最适合

中国区人民币档位细,文档、专业数据库、Agent 集群、AI 建站、桌面自动化与编程入口完整。

独特优势

K3 集群适合大规模并行研究,Kimi Websites 负责全栈建站;Kimi Work 连接本地文件与网页,Kimi Code 可使用 K3、K2.7 与 HighSpeed。

购买前注意

K3 与 Agent 会消耗 credits;Kimi Code 与会员共享额度,并同时受周度、5 小时和月度限制。API 与 Code 都有 low / high / max,但默认分别是 max 与 high。

ChatGPT 会员 + Codex

最适合

通用产品面最宽,聊天、语音、图像、深度研究、连接器、Sites、ChatGPT Work 与 Codex 组合完整。

独特优势

Codex 桌面端适合同时管理多个代理与工作树,终端、IDE、云端和自动化之间衔接成熟。

购买前注意

Plus 与 Pro 的可用量、附加 credits 和地区价格会变化;会员额度与 API 按量计费仍是两套体系。

Claude 会员 + Claude Code

最适合

写作、长任务和完整产品交付体验成熟,Pro 已包含 Claude Code、Cowork、Design、Science、Research 与 Microsoft 365。

独特优势

Claude Code 的终端和 IDE 生态成熟,支持 VS Code、Cursor 与 JetBrains;复杂任务可在 Opus 规划和 Sonnet 执行之间分工。

购买前注意

网页、桌面、手机与 Claude Code 共用额度,并受滚动 5 小时及周度限制;环境中的 API Key 可能让 Claude Code 改走 API 计费。

第一次使用

第一次用 K3 最容易卡在哪

既包含普通用户的产品选择,也保留 CLI、HighSpeed、401 和第三方编程工具等开发者问题;这些答案都可以通过全站搜索直达。
01我已经会用 Codex 或 Claude Code,第一次应该下载哪个 Kimi 产品?

编程直接从 Kimi Code CLI 开始;本地文档、网页操作和定时任务用 Kimi Work;只是聊天或研究先用网页。不要为了试 K3 同时安装全部客户端。

02为什么付费后仍然不能在 Kimi Code 里调用 K3?

K3 的 Code 权限从 Moderato 开始。Moderato 最高 256K 上下文;Allegretto 及以上才有最高 1M。请求超出套餐权限时可能返回 401,重复重试不会解决。

03新用户应该优先装 VS Code 扩展吗?

目前不建议。官方说明新版 TypeScript CLI 用户暂不支持新装 VS Code 扩展,老 Python CLI 用户和既有扩展用户可以继续使用。新用户先装官方 CLI 最稳。

04K3、K2.7 Code 和 HighSpeed 应该怎么选?

复杂推理、3D、游戏和超长上下文先试 K3;常规工程优先成熟的 K2.7 Code;只在需要快速迭代时用 HighSpeed。HighSpeed 编码能力相同,输出约快 5—6 倍,但额度约按 3 倍消耗。

05为什么 Kimi Code 的额度看起来掉得很快?

K3 的长思考、长上下文,以及切换模型或推理档后的缓存失效都会增加消耗。日常先用 k3-256k + high;官方称 1M k3 约耗两倍额度。尽量在同一会话保持型号和 effort 不变,并在订阅页、Code 控制台或 /usage 查看实际用量。

06会员和开放平台 API 是一回事吗?

不是。会员更适合个人在 Kimi 网页、Work、Agent 和 Kimi Code 中使用;开放平台 API 按 token 计费,适合把模型接进自己的产品。比较成本时必须分开。

07能不能继续使用 Claude Code 等熟悉的工具?

可以。Kimi Code 提供 Anthropic 与 OpenAI 兼容接口和专用 API Key,第三方工具仍会消耗 Kimi 会员额度。密钥只应放在本机环境变量或工具的安全配置中,不能写进仓库。

08让 Kimi Work 读本地文件安全吗?

Kimi Work 对修改文件和运行代码提供“操作前询问”,但这不替代备份和权限管理。首次使用先给一个副本文件夹,只开放完成任务需要的最小范围,不要直接提供生产密钥。

09App 说 K3 集群可能消耗普通模式的 3 倍,到底是什么意思?

它更接近任务开始前的经验估算,不是固定结算公式。官方公开规则是按所有子 Agent 的实际 Token 合计,复杂度和子 Agent 数不同,总消耗也不同;所以通常不只是“扣得快三倍、最终总量不变”,而是同一目标可能花掉更多总额度。官方所说 3—4.5× 主要是大规模搜索关键步骤和完成时间的加速,也不是额度倍率。

10做编程项目时,集群一定比普通 K3 质量更好吗?

不一定。全仓库按模块审计、独立组件并行实现、测试与代码审查可以同时推进时,集群更可能提高覆盖面和速度;修一个 Bug、改共享核心或需要连续调试时,普通 K3 更容易保持一致。当前没有找到 K3 普通与集群在同一真实项目上的独立受控质量对照。

11K3 的 1M 上下文什么时候应该开?

只有资料接近或超过 256K,而且必须一次保留跨文件、跨文档关系时再开。少量文件、单个 Bug 和普通问答先用 k3-256k;1M 不会自动提高智力,官方还称在 Kimi Code 中约耗两倍额度。Allegretto 及以上才可用最高 1M。

12Kimi Code 的 k3 和 k3-256k 有什么区别?

在 256K 以内,两者使用同一 K3 模型,官方称结果相同。k3-256k 更省额度,适合日常问答、补全、常规功能和少量文件;k3 能扩到 1M 并支持视频输入。已有会话从 1M 往 256K 切时先 compact,避免超长历史或视频导致切换失败。

榜单不用硬记

这些分数分别在回答什么

当前定位见页首;下方历史记录保留各自日期,不与新版排名混列。AA、Vals、Arena 与 DeepSWE 测的不是同一件事,分数不能直接相加。
Artificial Analysis(AA)50 · AA v4.2(2026-09-05)

综合指数邻近 Sol xhigh 50 与 max 51;不是满分 100 的成功率。旧 v4.1.1 的 60 属于不同题目与权重,不能视为能力下降。

AA-Briefcase 的 1543 Elo、$10.57 与 56.4 分钟是 8 月历史运行,不当当前 v4.2 任务账单。
Vals Index · 2026-08-15 历史74.70% ±0.96 · 当时 #3/40

更偏金融、编程等真实经济任务。它与 AA 题目和权重不同,74.70% 不能和 AA 的 57 相加或直接比较大小。

当时 Opus 5 为 74.82%±1.35,二者误差重叠;当时 SWE-bench 第 4、Vibe Code 第 3,不当 9 月当前排名。
Arena 文本榜 · 2026-08-15 历史1486±10 · 当时第 10

由用户盲选更喜欢哪个回答,更容易反映表达、格式和整体体验,不等于事实正确率或工程成功率。

当时约 3,619 票且是 Preliminary(初步结果),排名区间较宽,不当当前榜单。
DeepSWE v1.169%±5 · $4.65 / 任务

把所有模型放进同一个代码代理,跑 113 个原创长程工程任务。K3 与 Opus、Sol、Fable、Terra 的误差区间重叠。

说明 K3 已能做严肃长程代码任务;81k 输出和 98 个步骤也说明低单价不等于过程很短。
CursorBench 3.2max 60.8% · $2.70 / 任务

测试来自真实 Cursor 会话里的模糊、多文件任务。K3 max 已达到可用水平,但没有压过 Opus 5 或 Sol 的高档位。

K3 high 为 59.7% / $1.89,max 为 60.8% / $2.70;约 1 分差先按接近档读,不能用这条编程轨道替代综合或网页专项结论。
专业证据层展开 2026-08-15 历史榜单、样本与方法记录15 条可追溯说明

以下是截至 2026-08-15 的发布后历史明细,保留当时题目、权重和排名。2026-09-05 的当前定位见页首与上方卡片;旧综合分不用于排列 Fable 5.1、Astra 等新版。

历史 AA v4.1.1 把 K3 列为 Intelligence Index 60,位于当时 Opus 5、Fable 5 以及几乎同分的 Sol / Grok 4.6 之后。60 不是百分制,也不等于真实世界 IQ。

AA-Briefcase 的发布拆解给 K3 约 1543 Elo、51% 客观规则通过率、分析质量 Elo 1754、呈现质量 Elo 1471。平均每项任务 $10.57、56.4 分钟、120k 输出 token 和 83 轮,说明 $3 / $15 的挂牌价不保证真实任务便宜或快。

AA 的其他发布后拆解同时显示强代理能力与事实风险:GDPval-AA v2 Elo 1668、AutomationBench-AA 53%;AA-Omniscience 准确率约 46%、幻觉率约 51%。重要事实仍必须保留引用核验。

历史 Vals 已收录精确型号 kimi/kimi-k3:Vals Index 74.70%±0.96,当时 #3/40;SWE-bench Verified 93.40%(第 4)、Vibe Code 84.96%(第 3)。当时 Opus 5 为 74.82%±1.35,误差区间重叠,不支持稳定区分。

Vals Index v1.2 使用私有题与经济权重:Finance 2.0、Coding 1.4;Coding 内 SWE-bench 子集和完整 Terminal-Bench 各占 25%,22 个 Vibe Code 任务占 50%。页面误差是 SEM,不覆盖提示词、随机种子、部署设置或生成随机性。

DeepSWE v1.1 用同一 mini-swe-agent 跑 113 个原创、长程代码任务:K3 max 为 69%±5,平均 $4.65、81k 输出 token、98 个步骤;Opus 5 max 74%±4、Sol max 73%±3。区间重叠,不能宣布唯一代码冠军。

Arena 文本总榜已列出 kimi-k3:1486±10,暂列第 10,约 3,619 票,标记为 Preliminary;当前排名区间仍较宽,不能解释成稳定胜出。

Arena Code 的早期分类榜中,K3 暂列 WebDev Overall 第 1(1679±17、1,757 票)、React 第 1(1692±22、1,223 票),HTML 第 2(1635±54、仅 154 票)。这支持“网页与视觉编程突出”,但误差和 Preliminary 状态决定它还不是生产工程冠军证明。

LiveBench 官方仓库和 Terminal-Bench 官方主页仍未找到 K3 独立提交;Vals 与 AA 内部运行的 Terminal-Bench 结果必须保留各自 harness,不能冒充官方榜新增了两个独立提交。

Moonshot 技术博客现已公开完整厂商自报表,并注明 KimiCode、Claude Code、Codex 等不同 harness;这比早期撤下截图完整,但仍是厂商组织的测试,不能替代 AA、Vals 或 Arena。

CursorBench 3.2 的同一模糊多文件任务中,K3 max 为 60.8% / $2.70,high 为 59.7% / $1.89;Opus 5 max 为 70.0%、Sol max 为 67.2%。这补足了 K3 的日常多文件工程边界:已经可用,但不是该轨道的领先者。

UK AISI 与美国 CAISI 的初步网络安全评估显示:K3 在 ExploitBench 为 32%、高于 GLM-5.2 的 24%,但低于领先闭源模型,41 个样本中没有完成任意代码执行;模拟企业攻击平均走到 32 步中的第 17 步。它不是当前高风险网络安全任务的优先模型。

Design Arena 的更新记录已确认 7 月 16 日加入 kimi-k3,但公开页面尚无稳定可引用的 K3 分数;它只能证明设计对比已经开始,不能作为新的正式名次。匿名测试名 Kivine 与正式 K3 的关系仍未获 Moonshot 或 Arena 明确确认。

Moonshot 自己的基准测试指南建议推理测试总题量至少达到 500—1000 题、代码测试把 max token 预算设到 256K。现有少量 Demo 远低于这个规模,因此只能用于发现强项和失败模式,不能替代正式排名。

如果你只记一句

K3 仍是开放权重与长资料强档,网页和 Agent 值得试;新版本最高综合点位见页首。模型约 1 分的差异不等于所有任务只差 1%,网页、视觉、长资料、事实准确性与工程执行仍需分轨比较。

待验证问题

哪些问题现在还没有足够证据

“没找到”不等于模型做不到;以下项目会继续监测,但在出现可复查材料前不会写成确定结论。
已补齐

API 与 Kimi Code 的推理档

两边现在都支持 low / high / max;开放平台 API 默认 max,Kimi Code 的 k3 / k3-256k 默认 high。产品入口与默认值仍需分开写。

主要文件已补齐

权重与许可已发布,实际部署成本仍待验证

官方 GitHub、Hugging Face、Kimi K3 License、技术报告和 vLLM / SGLang 入口已经出现;仍缺不同硬件规模下的独立吞吐、显存、稳定性和总拥有成本对照。

暂无独立提交

开放代码与终端榜单

LiveBench 与 Terminal-Bench 官方榜仍无 K3 独立提交;Design Arena 已加入 K3 但尚无稳定公开分数。AA / Vals 内部同名测试不能当成官方提交重复计数。

部分确认

同任务成功成本与订阅额度

DeepSWE 已给同代理代码任务的通过率与成本,AA-Briefcase 也给知识工作成本;但订阅 credits 不是 API 美元,集群、1M、重试与人工返工仍不能统一换算。

已有一条受控轨道

生产后端与大型仓库稳定性

DeepSWE 113 个原创长程任务证明 K3 已进入严肃工程候选;但它不是特定企业仓库的生产验收,仍缺中文大型仓库、持续多日任务和真实部署故障复测。

专项边界已确认

网络安全不是当前首选强项

AISI / CAISI 的初步测试显示 K3 高于 GLM-5.2,但显著落后领先闭源模型;样本与保护设置有限,不能外推全部安全编码,不过足以阻止“安全任务也属最强档”的泛化。

样本不足

中文写作与长文事实性

当前证据集中在前端、代理和代码任务;AA 已记录准确率提升同时幻觉率升到 51%,但尚未有足够可复查的中文写作、长文一致性、引用准确率与事实性对照。

论坛与开发者实测

早期体验同时出现了强项与短板

这些是有具体任务或结果描述的社区信号,不作为正式排行榜分数。
覆盖范围十余个可复查任务或讨论串

去重同一任务的转述,覆盖 LINUX DO、Reddit、Arena 演示与独立开发者记录;每条卡片现已标注 A/B 等级和样本范围。

重复出现网页与 React 已有正式早期排名信号

Arena WebDev 与 React 暂列第 1,复杂前端、3D、网页游戏和创意视频样本方向一致;生产仓库稳定性仍要另测。

最大分歧工程稳定性高度依赖任务与运行环境

稳定环境中恶性 Bug 很少;另一些样本仍有纹理、交互、细节返工和长思考问题。

重复风险信号至少 5 个独立作者 / 讨论串提到额度压力

数字来自不同套餐、客户端和任务,不能换算成统一 token 上限;只用于提醒先做小任务验证。

独立评测新证据AA、Vals、Arena、DeepSWE 与 CursorBench 已交叉

五者分别覆盖综合与知识工作、经济任务、人类偏好、原创长程代码和模糊多文件;方向一致但不能相加,事实任务和安全专项仍保留限制。

B 级体验信号多个公开样例,按任务去重

前端与视觉完成度受到集中称赞

多组 Arena 和网页端样例认为 K3 的复杂前端、3D 场景和一次性成品完成度进入前沿水平;这类结果更能说明视觉编程潜力,不能代替仓库工程测试。

K3 早期前端样例汇总
A 级单一样本1 个 API SVG 任务

简单视觉任务也可能触发大量思考

Simon Willison 的可复查 SVG 测试只输入 95 token,却输出 16,658 token,其中 13,241 token 为 reasoning,成本约 $0.25;结果展现了较好的空间理解,也说明高推理档对简单任务可能过度思考。现在 API 已支持 low / high / max,因此应按任务降档,而不是把旧的 max-only 状态继续当成限制。单个任务不能外推为综合基准。

Simon Willison K3 SVG 实测
A 级单一环境1 名作者,多轮复测

正式版实测开始出现规划与工具能力信号

一组正式版稳定环境记录认为,K3 几乎没有出现恶性 Bug,规划、调度、意图理解和工具使用超出预期;同一记录也指出代码直觉仍弱、上千秒思考常见。单一环境结果只能作为方向性信号。

LINUX DO 正式版任务记录
B 级体验信号1 个讨论串,多名早期用户

正式上线初期仍有稳定性与额度反馈

Reddit 早期用户既报告了优于部分 GPT‑5.6 Sol 前端结果的体验,也出现任务未完成、内部错误、速度慢和单次任务消耗较大的反馈。样本很少,只能作为风险提示。

Reddit K3 初期使用讨论
A/B 混合信号2 个独立创意任务

创意任务已从静态前端扩展到游戏与视频

网页游戏样本完成了牌组循环、随机地图和回合结算,另一个视频生成记录也肯定 K3 的创意表现;但评论区同时发现纹理方向、快捷键和 UI 细节问题,视频作者也明确指出速度慢。它扩大了正面样本的场景范围,仍不能证明大型代码仓库更可靠。

LINUX DO 网页游戏与评论复查
A/B 混合信号至少 5 名独立作者 / 5 个讨论串

API 单价与订阅额度成为重复出现的使用门槛

K3 的 $3 / $15 API 单价明显高于 Kimi 上一代。两个 LINUX DO 任务记录与三个新 Reddit 讨论中,至少 5 个独立作者 / 讨论串重复报告配额下降快、单任务触顶或产品回退;其中也有“答案很好”和“仍可完成工作”的正面反馈。套餐、客户端、上下文和反推方法不同,不能换算统一成本。

LINUX DO 与 Reddit 额度任务复查
A/B 混合信号1 个截图任务 + 1 个反例

客户端与 Agent 集群仍有发布初期故障

一组带截图的正式版测试报告 Agent 集群在调度子代理时自动中止,并观察到客户端思考过程全部为英文;评论区另有同提示前端只略强于 GLM-5.2 的反例。这些更像客户端适配和早期服务问题,不能直接归因于基础模型能力。

LINUX DO K3 客户端测试与评论区

本页核验时间

2026-09-05 当前定位;详细历史研究截至 2026-08-15(UTC+8)

模型刚发布,独立成绩和产品限制仍可能快速变化。