想做网页、复杂资料或并行调研的人
K3 的突出点不是“什么都第一”,而是能把网页与 React 原型、长资料、图片 / 视频理解和多步骤 Agent 任务放在同一套产品里完成。
专业口径:1M 上下文、多模态输入、WebDev / React 早期领先,并提供 K3 集群与动态工具能力。Moonshot通用旗舰 · 新发布核验 2026-08-15
网页与 React 原型、长资料、并行调研、图片 / 视频理解、长程 Agent,以及具备大型推理基础设施的开放权重部署
AA v4.2 max 50、GLM-5.3 max 49;开放权重高端。完整应用、终端与长程任务方向不同,不固化为通用第三名。
AA v4.2:50 · max · 原页未标估算 · 核验 2026-09-05
当前 AA v4.2:K3 50、Sol max 51、Astra max 55、Fable 5.1 max 57(含回退)。DeepSWE 的 K3 max 69%±5 与多款强模型区间重叠。旧 AA v4.1.1 的 60 和 8 月 Vals 排名保留为历史,不拿来比较新型号。
60 秒看懂
K3 的突出点不是“什么都第一”,而是能把网页与 React 原型、长资料、图片 / 视频理解和多步骤 Agent 任务放在同一套产品里完成。
专业口径:1M 上下文、多模态输入、WebDev / React 早期领先,并提供 K3 集群与动态工具能力。只是聊天先用免费版;要在 Kimi Code 使用 K3 或需要 Agent 集群,再看 ¥99 档。日常编程选 k3-256k + high;只有资料真的很长、需要 Kimi Claw 或 1M K3 才看 ¥199 档。
专业口径:Moderato 是 K3 Code / Agent 集群起点;k3-256k 与 1M k3 在 256K 内结果相同,官方称 1M 版本约耗两倍 Code 额度。Allegretto 才开放 Claw、最高 1M 与 20× Code 额度。重要事实要回到原始来源核对;短任务不必开更耗额度的集群。K3 虽然已经能下载,但完整文件约 1.42 TiB,普通个人电脑并不适合直接部署。
专业口径:AA 记录事实性风险;API 已支持 low / high / max,但默认 max。完整权重、技术报告与自部署说明已发布,许可证为带商业条件的 Kimi K3 License,不是 MIT。从实际任务看
已有网页与视觉原型信号,复杂中文前端仍值得单独试;不延用旧第三名。
较强:完整应用 + 模糊多文件任务 · 判断把握 高创意候选前端视觉、动效与响应式复杂前端、3D 和网页游戏早期样本很强,仍要防止细节返工。
中高:Arena WebDev / React 初榜 + 应用分榜 · 判断把握 中高新旗舰候选中文写作与润色知识工作和长上下文强,但写作专项证据仍少。
编辑判断:建议用个人语料盲测 · 判断把握 中长文、图片与视频候选超长资料、PDF 与多模态理解官方 API 支持 1M 上下文及图片、视频输入,适合大资料包。
中高:官方模态规格 + 综合任务 · 判断把握 中高国内产品候选表格、PPT 与 Office 成品Kimi Work 和会员产品覆盖文档、PPT、数据库与本地文件。
工具优先:不设纯模型冠军 · 判断把握 中长程新候选跨工具、多代理与超长任务DeepSWE 为 69%±5,API 已支持 low / high / max;Code 日常可用 k3-256k 控制额度。
中高:跨领域代理任务 + 工具行为信号 · 判断把握 中高普通 K3、集群与 1M 怎么选
目标连贯、步骤互相依赖,需要你边看边改
支线相互独立,可以同时搜索、实现、审查再汇总
Kimi 官方说明,Agent 按实际 Token 消耗 credits;集群通常会消耗普通 Agent 的数倍,具体取决于任务复杂度和子 Agent 数量。公开帮助页没有承诺一个固定的 3× 公式,因此 App 中的“约 3 倍”更适合当作使用前估算,而不是结算保证。
官方另一个 3—4.5× 指标说的是大规模搜索中的最少关键步骤和实际完成时间最多缩短到约 1/3—1/4.5,并不是额度倍率。速度变快与总 Token 变多可以同时发生。
Kimi Code 文档里“约 6× 输出速度、约 3× 额度”明确属于 K2.7 HighSpeed,是另一个功能,不能拿来证明 K3 集群固定扣 3 倍。
怎么实测:判断划不划算要看任务结束后的总 credits、成功率和返工,而不是只看每分钟掉得多快。第一次先用一小块真实任务对照普通模式,确认并行确实节省等待或增加覆盖,再扩大。
项目越能按独立模块、测试或资料组拆开,集群越可能有收益;共享状态和串行依赖越多,合并风险越大。
不同子 Agent 可以分别查来源、读模块、跑测试和做审查,减少一条上下文里互相挤占信息;任务越可拆分,收益越明显。
多个 Agent 不等于同一个 Agent 的智力变成数倍。最终质量仍取决于任务拆分、共享约束、验收标准和主 Agent 的合并能力。
如果子任务互相等待、同时修改同一文件或各自采用不同假设,重复工作、接口冲突和遗漏会抵消并行收益。当前也没有找到 K3 普通与集群在同一真实项目上的独立受控质量对照。
日常问答、补全、常规功能和少量文件先选 k3-256k + high;只有发现压缩会破坏全局关系再升 1M。
先给资料做目录和优先级,明确哪些是事实来源、哪些只是背景,不把 1M 当作无差别文件箱。
从 1M 切到 256K 前先手动 compact;若历史已超过 256K或含视频,工具会压缩或切换失败。反向从 256K 升 1M,当前版本可直接切且不影响缓存。
会话内保持同一模型和推理档;切换 effort 会使缓存失效,需要换档时更适合新开会话。
Kimi Code:Moderato 可用 k3-256k,并可使用 k3 到 256K;Allegretto 及以上才可把 k3 用到最高 1M。
一名 Allegretto 用户称普通研究 / 写作集群任务约消耗池子的 5%—10%,因此每月只在真正并行的任务上用 1—2 次;这是单一套餐与工作流经验,不能外推成固定比例。
Reddit Agent Swarm 用量复盘 ↗一个 LINUX DO 单一后端任务记录中,Kimi CLI / Work、带子 Agent 的第三方框架与 Claude Code 的用量差异很大;它说明 harness 会改变总消耗,不能只按基础模型名估算。
LINUX DO 同任务多工具记录 ↗V2EX 和 Reddit 各有单一用户报告半小时集群消耗约四分之一月额度、1M 会话接近用完 5 小时窗口,或一天重度集群用掉超过半周额度。样本不可比,只能作为先做小样本的风险提示。
V2EX K3 集群与 1M 体验 ↗给需要核对规格的人
官方 API 型号为 kimi-k3,已可通过 Chat Completions 调用。
总参数 2.8T,使用 Kimi Delta Attention 与 Attention Residuals;官方 API 已明确支持图片与视频输入。
上下文为 1,048,576 token(约 100 万 token);缓存命中 / 普通输入 / 输出价格为 $0.30 / $3 / $15。
产品口径必须分开:开放平台 API 的 kimi-k3 始终思考,现已支持 reasoning_effort=low / high / max,默认 max;Kimi Code 的 k3 与 k3-256k 也支持三档,但默认 high。
单次生成默认上限为 131,072 token,可设置到 1,048,576 token;temperature、top_p 等采样参数目前固定。
API 支持严格 JSON Schema、tool_choice、动态工具加载和自动缓存;这些是集成能力,不等于所有代理工作台都已有相同体验。
Kimi Code 已新增 k3-256k:在 256K 内与 k3 使用同一 K3 模型且官方称结果相同,1M k3 约消耗两倍额度;k3-256k 不支持视频输入。
Kimi Code 的 k3 与 k3-256k 从 Moderato 起可用;Moderato 的 k3 最高 256K,Allegretto 及以上才可使用最高 1M。两者默认 high,关闭思考会路由到 K2.6,并不是非思考版 K3。
切换模型或 reasoning effort 都会使现有上下文缓存失效;官方建议选定档位后保持会话内一致,真正需要切换时新建会话。
Moonshot 已于 2026 年 7 月 27 日在官方 GitHub 与 Hugging Face 发布完整 K3 权重、技术报告、自部署说明和 Kimi K3 License;因此 K3 现在可以自行部署,但应准确写成“开放权重”,不把自定义许可证简化成 MIT 或无条件开源。
截至 2026 年 7 月 31 日,官方 Hugging Face 仓库包含 96 个 safetensors 分片,权重文件合计约 1.42 TiB。这个数字说明它需要大型存储与推理基础设施,不等于官方给出了某种固定 GPU 最低配置。
Kimi K3 License 允许使用、修改、部署和衍生开发,但大型 Model-as-a-Service 商业业务和达到指定规模的商业产品有额外协议或显著标识要求;内部使用及官方或认证推理伙伴另有例外。商业部署前应直接核对许可证原文。
API 和 Kimi Code 现在都有 low / high / max,但默认值不同:API 默认 max,Code 默认 high。官方同时承认 K3 对思考历史敏感、可能过度主动。
Kimi 网页与 App 已把 K3 和 K3 集群分别列为 Low / High / Max:普通 K3 面向 Chat 与 Agent,K3 集群面向大规模搜索和批处理;K2.6 不消耗 credits,K3 与 K3 集群会消耗。
K3 网页产品内置 Web Search、Fetch、Image Search、IPython 与 Memory;Kimi Agent 可完成研究、文档、表格、PPT 和网站任务。官方称 K3 集群最多可调度 300 个子智能体、单次超过 4,000 次工具调用,但仍是 Beta 且额度消耗较高。
Kimi Websites 是 K3 驱动的全栈建站产品,可从自然语言、截图或录屏生成前后端,并提供数据库、登录鉴权、版本管理、在线预览、部署与代码导出;这是 Kimi 产品能力,不等于裸 API 自动包含整套建站环境。
Kimi Code 明确与 Kimi 综合会员共享同一额度:Code 每 7 天刷新,还有滚动 5 小时和月度总额度;所有登录设备与 API Key 共用。
Extra Usage 已上线:订阅额度用完后可按实际用量继续使用,网页与 Kimi Code 共用余额;订阅额度先扣,Extra Usage 最后兜底,可设置月度消费上限。
国内新用户赠送的 15 元代金券不能用于 K3;官方同时提示内置网页搜索正在更新,近期不建议用于生产流程。
中国区会员选择
从满足功能的最低档开始;没有命中明确门槛,就不要为“也许会用”提前买高档。
K2.6 不消耗会员额度(credits);K3 与 K3 集群会消耗。先用免费入口确认回答风格和基础功能是否适合自己,不必急着付费。
Kimi Code 额度为 1×,适合低频尝试;但 Kimi Code 中不能使用 K3。
这是 Agent 集群和 Kimi Code 使用 K3 的最低档;日常编程可选更省额度的 k3-256k,或把 k3 用到最高 256K。
Kimi Claw 从这一档开放,同时解锁 K3 最高 1M 上下文和 20× Code 额度。
主要价值是 60× Code 和更高 Agent 用量;不会因此获得比 Allegretto 更强的 K3。
只聊天就免费;要 Agent 集群或 K3 编程从 ¥99 起;要 Kimi Claw 或 K3 最高 1M 从 ¥199 起。
官方当前套餐页未列出统一的付费档免费试用,开通后原则上不可退费。未确认长期使用前,不把年付折扣当成必省的钱。
在「设置 → 订阅」查看剩余额度、下次刷新时间和最近 1,000 条用量,记录 Kimi 实际替代了哪些现有工具。
不够用可按剩余价值折算升级并立即生效;想降档则先取消续费,到期后再订低档,也可以直接不续。
再用「预计闲置天数 × 日均成本」判断今天开通是否值得。
无需年付
¥468/年(省 ¥120)
¥948/年(省 ¥240)
第一次用 K3 编程推荐从这里开始¥1,908/年(省 ¥480)
¥6,708/年(省 ¥1,680)
年付只有在你已经确认长期使用时才更省;第一次购买仍建议先按月验证。
这里回答“买错、浪费、忘记续费和已有其他会员怎么办”,不使用限售传闻制造紧迫感。
先只看功能门槛:只用 K2.6 可先从免费版开始;要 Agent 集群或在 Kimi Code 里用 K3,最低是 Moderato ¥99;要 Kimi Claw 或 K3 最高 1M,最低是 Allegretto ¥199。没有明确命中这些功能时,不必为了“可能会用”买更高档。
没有可靠证据支持因限售传闻提前锁定年包。当前官方规则允许在订阅页升级,并按剩余价值折算、当天生效;未来供应和规则没人能保证,购买当天再核对官方页,比为未证实的变化预付一年更稳妥。
先把情绪换成算术:月费 ÷ 30。Andante、Moderato、Allegretto、Allegro 分别约为 ¥1.6、¥3.3、¥6.6、¥23.3/天。用“闲置天数 × 日均成本”判断可接受损失,再决定今天开还是等真正要用时再开。
开通后即可在 Kimi「设置 → 订阅管理」或微信、支付宝、Apple ID 的自动扣款管理中取消续费;取消后当前周期权益仍保留到到期日。支付渠道是否提醒取决于你的通知设置,最好同时在扣款渠道复查一次。
付费虚拟服务原则上不可退费,但从低档升级会按剩余价值折算并立即生效;降档不能在周期中途完成,需要先取消续费,到期后再订低档。因此第一次从满足功能的最低档包月开始,通常比一步到位更稳。
不一定。可以等待每 7 天或月度额度恢复,也可给订阅账户开启 Extra Usage 按实际用量继续。先设月度消费上限;如果连续多周都靠 Extra Usage 补量,再比较升级套餐是否更便宜。Extra Usage 余额一般不可退,但不会过期。
先买一个月的最低可用档,并记录 Kimi 实际替代了哪些现有订阅用量:聊天、研究、Office、Agent 还是 Code。只有替代关系和额度消耗连续可见后,再决定长期保留、升级、转年付,或停掉其中一个订阅。
有 Adagio 免费档;官方套餐页未列出统一的付费试用,账号如出现活动试用须看清转正扣费规则;付费服务开通后原则上不可退费。
升级按剩余价值折算并立即生效;降级需取消续费,当前周期结束后再订低档。
Kimi 设置、微信、支付宝或 Apple ID 均可管理;取消后权益保留至当前周期结束。
订阅页可看月度额度,Kimi Code 控制台或 /usage 可看 Code 与 Extra Usage;发票入口在「设置 → 订阅 → 账单 → 发票」。
软件与入口
适合随手问答、上传资料和使用云端 Agent。工作需要进入本地文件夹或持续运行时,再换 Kimi Work。
打开 Kimi ↗K3 适合普通 Agent 任务;K3 集群面向大规模搜索和批处理,官方称最多可调度 300 个子智能体、单次超过 4,000 次工具调用。集群仍是 Beta 且更耗额度,小任务不必使用。
查看 Agent 集群 ↗可生成前后端、数据库和登录鉴权,并提供版本、预览、部署与代码导出。先把它当作 Kimi 的托管建站产品测试,不把成品表现直接等同于裸 K3 API。
打开 Kimi Websites ↗Windows 与 Apple 芯片 Mac 可用;能挂载本地文件夹、运行 Python / Shell、使用 WebBridge 操作网页并设置定时任务。K3 在具体账号或客户端中的可用性以模型选择器为准。
下载 Kimi Work ↗体验最接近 Claude Code。新版 CLI 基于 Node.js,Windows、macOS 和 Linux 均可安装;运行 kimi 后用 /login 登录,无需手动管理 API Key。
查看 CLI 安装 ↗官方提供 OpenAI 与 Anthropic 兼容接口,可接入支持自定义模型的工具。Claude Code 用户可按官方指南接入;Codex 用户若只是想试 Kimi,先并行使用 Kimi CLI 更省事。
查看接入说明 ↗如果你不使用终端,可以跳过这一段,继续使用 Kimi 网页、Agent 或 Websites。
安装新版 Kimi Code CLI
在终端运行 kimi
输入 /login 登录
用 /model 选择 K3 或 K2.7
新用户暂不建议把 VS Code 扩展作为第一入口:官方当前仍限制新版 TypeScript CLI 用户的新装资格。
产品组合对比
中国区人民币档位细,文档、专业数据库、Agent 集群、AI 建站、桌面自动化与编程入口完整。
K3 集群适合大规模并行研究,Kimi Websites 负责全栈建站;Kimi Work 连接本地文件与网页,Kimi Code 可使用 K3、K2.7 与 HighSpeed。
K3 与 Agent 会消耗 credits;Kimi Code 与会员共享额度,并同时受周度、5 小时和月度限制。API 与 Code 都有 low / high / max,但默认分别是 max 与 high。
通用产品面最宽,聊天、语音、图像、深度研究、连接器、Sites、ChatGPT Work 与 Codex 组合完整。
Codex 桌面端适合同时管理多个代理与工作树,终端、IDE、云端和自动化之间衔接成熟。
Plus 与 Pro 的可用量、附加 credits 和地区价格会变化;会员额度与 API 按量计费仍是两套体系。
写作、长任务和完整产品交付体验成熟,Pro 已包含 Claude Code、Cowork、Design、Science、Research 与 Microsoft 365。
Claude Code 的终端和 IDE 生态成熟,支持 VS Code、Cursor 与 JetBrains;复杂任务可在 Opus 规划和 Sonnet 执行之间分工。
网页、桌面、手机与 Claude Code 共用额度,并受滚动 5 小时及周度限制;环境中的 API Key 可能让 Claude Code 改走 API 计费。
第一次使用
编程直接从 Kimi Code CLI 开始;本地文档、网页操作和定时任务用 Kimi Work;只是聊天或研究先用网页。不要为了试 K3 同时安装全部客户端。
K3 的 Code 权限从 Moderato 开始。Moderato 最高 256K 上下文;Allegretto 及以上才有最高 1M。请求超出套餐权限时可能返回 401,重复重试不会解决。
目前不建议。官方说明新版 TypeScript CLI 用户暂不支持新装 VS Code 扩展,老 Python CLI 用户和既有扩展用户可以继续使用。新用户先装官方 CLI 最稳。
复杂推理、3D、游戏和超长上下文先试 K3;常规工程优先成熟的 K2.7 Code;只在需要快速迭代时用 HighSpeed。HighSpeed 编码能力相同,输出约快 5—6 倍,但额度约按 3 倍消耗。
K3 的长思考、长上下文,以及切换模型或推理档后的缓存失效都会增加消耗。日常先用 k3-256k + high;官方称 1M k3 约耗两倍额度。尽量在同一会话保持型号和 effort 不变,并在订阅页、Code 控制台或 /usage 查看实际用量。
不是。会员更适合个人在 Kimi 网页、Work、Agent 和 Kimi Code 中使用;开放平台 API 按 token 计费,适合把模型接进自己的产品。比较成本时必须分开。
可以。Kimi Code 提供 Anthropic 与 OpenAI 兼容接口和专用 API Key,第三方工具仍会消耗 Kimi 会员额度。密钥只应放在本机环境变量或工具的安全配置中,不能写进仓库。
Kimi Work 对修改文件和运行代码提供“操作前询问”,但这不替代备份和权限管理。首次使用先给一个副本文件夹,只开放完成任务需要的最小范围,不要直接提供生产密钥。
它更接近任务开始前的经验估算,不是固定结算公式。官方公开规则是按所有子 Agent 的实际 Token 合计,复杂度和子 Agent 数不同,总消耗也不同;所以通常不只是“扣得快三倍、最终总量不变”,而是同一目标可能花掉更多总额度。官方所说 3—4.5× 主要是大规模搜索关键步骤和完成时间的加速,也不是额度倍率。
不一定。全仓库按模块审计、独立组件并行实现、测试与代码审查可以同时推进时,集群更可能提高覆盖面和速度;修一个 Bug、改共享核心或需要连续调试时,普通 K3 更容易保持一致。当前没有找到 K3 普通与集群在同一真实项目上的独立受控质量对照。
只有资料接近或超过 256K,而且必须一次保留跨文件、跨文档关系时再开。少量文件、单个 Bug 和普通问答先用 k3-256k;1M 不会自动提高智力,官方还称在 Kimi Code 中约耗两倍额度。Allegretto 及以上才可用最高 1M。
在 256K 以内,两者使用同一 K3 模型,官方称结果相同。k3-256k 更省额度,适合日常问答、补全、常规功能和少量文件;k3 能扩到 1M 并支持视频输入。已有会话从 1M 往 256K 切时先 compact,避免超长历史或视频导致切换失败。
榜单不用硬记
综合指数邻近 Sol xhigh 50 与 max 51;不是满分 100 的成功率。旧 v4.1.1 的 60 属于不同题目与权重,不能视为能力下降。
AA-Briefcase 的 1543 Elo、$10.57 与 56.4 分钟是 8 月历史运行,不当当前 v4.2 任务账单。更偏金融、编程等真实经济任务。它与 AA 题目和权重不同,74.70% 不能和 AA 的 57 相加或直接比较大小。
当时 Opus 5 为 74.82%±1.35,二者误差重叠;当时 SWE-bench 第 4、Vibe Code 第 3,不当 9 月当前排名。由用户盲选更喜欢哪个回答,更容易反映表达、格式和整体体验,不等于事实正确率或工程成功率。
当时约 3,619 票且是 Preliminary(初步结果),排名区间较宽,不当当前榜单。把所有模型放进同一个代码代理,跑 113 个原创长程工程任务。K3 与 Opus、Sol、Fable、Terra 的误差区间重叠。
说明 K3 已能做严肃长程代码任务;81k 输出和 98 个步骤也说明低单价不等于过程很短。测试来自真实 Cursor 会话里的模糊、多文件任务。K3 max 已达到可用水平,但没有压过 Opus 5 或 Sol 的高档位。
K3 high 为 59.7% / $1.89,max 为 60.8% / $2.70;约 1 分差先按接近档读,不能用这条编程轨道替代综合或网页专项结论。以下是截至 2026-08-15 的发布后历史明细,保留当时题目、权重和排名。2026-09-05 的当前定位见页首与上方卡片;旧综合分不用于排列 Fable 5.1、Astra 等新版。
历史 AA v4.1.1 把 K3 列为 Intelligence Index 60,位于当时 Opus 5、Fable 5 以及几乎同分的 Sol / Grok 4.6 之后。60 不是百分制,也不等于真实世界 IQ。
AA-Briefcase 的发布拆解给 K3 约 1543 Elo、51% 客观规则通过率、分析质量 Elo 1754、呈现质量 Elo 1471。平均每项任务 $10.57、56.4 分钟、120k 输出 token 和 83 轮,说明 $3 / $15 的挂牌价不保证真实任务便宜或快。
AA 的其他发布后拆解同时显示强代理能力与事实风险:GDPval-AA v2 Elo 1668、AutomationBench-AA 53%;AA-Omniscience 准确率约 46%、幻觉率约 51%。重要事实仍必须保留引用核验。
历史 Vals 已收录精确型号 kimi/kimi-k3:Vals Index 74.70%±0.96,当时 #3/40;SWE-bench Verified 93.40%(第 4)、Vibe Code 84.96%(第 3)。当时 Opus 5 为 74.82%±1.35,误差区间重叠,不支持稳定区分。
Vals Index v1.2 使用私有题与经济权重:Finance 2.0、Coding 1.4;Coding 内 SWE-bench 子集和完整 Terminal-Bench 各占 25%,22 个 Vibe Code 任务占 50%。页面误差是 SEM,不覆盖提示词、随机种子、部署设置或生成随机性。
DeepSWE v1.1 用同一 mini-swe-agent 跑 113 个原创、长程代码任务:K3 max 为 69%±5,平均 $4.65、81k 输出 token、98 个步骤;Opus 5 max 74%±4、Sol max 73%±3。区间重叠,不能宣布唯一代码冠军。
Arena 文本总榜已列出 kimi-k3:1486±10,暂列第 10,约 3,619 票,标记为 Preliminary;当前排名区间仍较宽,不能解释成稳定胜出。
Arena Code 的早期分类榜中,K3 暂列 WebDev Overall 第 1(1679±17、1,757 票)、React 第 1(1692±22、1,223 票),HTML 第 2(1635±54、仅 154 票)。这支持“网页与视觉编程突出”,但误差和 Preliminary 状态决定它还不是生产工程冠军证明。
LiveBench 官方仓库和 Terminal-Bench 官方主页仍未找到 K3 独立提交;Vals 与 AA 内部运行的 Terminal-Bench 结果必须保留各自 harness,不能冒充官方榜新增了两个独立提交。
Moonshot 技术博客现已公开完整厂商自报表,并注明 KimiCode、Claude Code、Codex 等不同 harness;这比早期撤下截图完整,但仍是厂商组织的测试,不能替代 AA、Vals 或 Arena。
CursorBench 3.2 的同一模糊多文件任务中,K3 max 为 60.8% / $2.70,high 为 59.7% / $1.89;Opus 5 max 为 70.0%、Sol max 为 67.2%。这补足了 K3 的日常多文件工程边界:已经可用,但不是该轨道的领先者。
UK AISI 与美国 CAISI 的初步网络安全评估显示:K3 在 ExploitBench 为 32%、高于 GLM-5.2 的 24%,但低于领先闭源模型,41 个样本中没有完成任意代码执行;模拟企业攻击平均走到 32 步中的第 17 步。它不是当前高风险网络安全任务的优先模型。
Design Arena 的更新记录已确认 7 月 16 日加入 kimi-k3,但公开页面尚无稳定可引用的 K3 分数;它只能证明设计对比已经开始,不能作为新的正式名次。匿名测试名 Kivine 与正式 K3 的关系仍未获 Moonshot 或 Arena 明确确认。
Moonshot 自己的基准测试指南建议推理测试总题量至少达到 500—1000 题、代码测试把 max token 预算设到 256K。现有少量 Demo 远低于这个规模,因此只能用于发现强项和失败模式,不能替代正式排名。
K3 仍是开放权重与长资料强档,网页和 Agent 值得试;新版本最高综合点位见页首。模型约 1 分的差异不等于所有任务只差 1%,网页、视觉、长资料、事实准确性与工程执行仍需分轨比较。
待验证问题
两边现在都支持 low / high / max;开放平台 API 默认 max,Kimi Code 的 k3 / k3-256k 默认 high。产品入口与默认值仍需分开写。
官方 GitHub、Hugging Face、Kimi K3 License、技术报告和 vLLM / SGLang 入口已经出现;仍缺不同硬件规模下的独立吞吐、显存、稳定性和总拥有成本对照。
LiveBench 与 Terminal-Bench 官方榜仍无 K3 独立提交;Design Arena 已加入 K3 但尚无稳定公开分数。AA / Vals 内部同名测试不能当成官方提交重复计数。
DeepSWE 已给同代理代码任务的通过率与成本,AA-Briefcase 也给知识工作成本;但订阅 credits 不是 API 美元,集群、1M、重试与人工返工仍不能统一换算。
DeepSWE 113 个原创长程任务证明 K3 已进入严肃工程候选;但它不是特定企业仓库的生产验收,仍缺中文大型仓库、持续多日任务和真实部署故障复测。
AISI / CAISI 的初步测试显示 K3 高于 GLM-5.2,但显著落后领先闭源模型;样本与保护设置有限,不能外推全部安全编码,不过足以阻止“安全任务也属最强档”的泛化。
当前证据集中在前端、代理和代码任务;AA 已记录准确率提升同时幻觉率升到 51%,但尚未有足够可复查的中文写作、长文一致性、引用准确率与事实性对照。
论坛与开发者实测
去重同一任务的转述,覆盖 LINUX DO、Reddit、Arena 演示与独立开发者记录;每条卡片现已标注 A/B 等级和样本范围。
Arena WebDev 与 React 暂列第 1,复杂前端、3D、网页游戏和创意视频样本方向一致;生产仓库稳定性仍要另测。
稳定环境中恶性 Bug 很少;另一些样本仍有纹理、交互、细节返工和长思考问题。
数字来自不同套餐、客户端和任务,不能换算成统一 token 上限;只用于提醒先做小任务验证。
五者分别覆盖综合与知识工作、经济任务、人类偏好、原创长程代码和模糊多文件;方向一致但不能相加,事实任务和安全专项仍保留限制。
多组 Arena 和网页端样例认为 K3 的复杂前端、3D 场景和一次性成品完成度进入前沿水平;这类结果更能说明视觉编程潜力,不能代替仓库工程测试。
K3 早期前端样例汇总 ↗Simon Willison 的可复查 SVG 测试只输入 95 token,却输出 16,658 token,其中 13,241 token 为 reasoning,成本约 $0.25;结果展现了较好的空间理解,也说明高推理档对简单任务可能过度思考。现在 API 已支持 low / high / max,因此应按任务降档,而不是把旧的 max-only 状态继续当成限制。单个任务不能外推为综合基准。
Simon Willison K3 SVG 实测 ↗一组正式版稳定环境记录认为,K3 几乎没有出现恶性 Bug,规划、调度、意图理解和工具使用超出预期;同一记录也指出代码直觉仍弱、上千秒思考常见。单一环境结果只能作为方向性信号。
LINUX DO 正式版任务记录 ↗Reddit 早期用户既报告了优于部分 GPT‑5.6 Sol 前端结果的体验,也出现任务未完成、内部错误、速度慢和单次任务消耗较大的反馈。样本很少,只能作为风险提示。
Reddit K3 初期使用讨论 ↗网页游戏样本完成了牌组循环、随机地图和回合结算,另一个视频生成记录也肯定 K3 的创意表现;但评论区同时发现纹理方向、快捷键和 UI 细节问题,视频作者也明确指出速度慢。它扩大了正面样本的场景范围,仍不能证明大型代码仓库更可靠。
LINUX DO 网页游戏与评论复查 ↗K3 的 $3 / $15 API 单价明显高于 Kimi 上一代。两个 LINUX DO 任务记录与三个新 Reddit 讨论中,至少 5 个独立作者 / 讨论串重复报告配额下降快、单任务触顶或产品回退;其中也有“答案很好”和“仍可完成工作”的正面反馈。套餐、客户端、上下文和反推方法不同,不能换算统一成本。
LINUX DO 与 Reddit 额度任务复查 ↗一组带截图的正式版测试报告 Agent 集群在调度子代理时自动中止,并观察到客户端思考过程全部为英文;评论区另有同提示前端只略强于 GLM-5.2 的反例。这些更像客户端适配和早期服务问题,不能直接归因于基础模型能力。
LINUX DO K3 客户端测试与评论区 ↗本页核验时间