2026 年 7 月 16 日,月之暗面正式发布 Kimi K3。

这款模型最显眼的数字是 2.8 万亿参数、100 万 token 上下文,以及 896 个专家中每次激活 16 个专家。月之暗面将它称为全球首个“3 万亿级开放模型”,并把目标直接放在长程编程、知识工作、深度研究和复杂推理上,而不再只强调聊天体验或低成本替代。

Kimi K3 已经上线 Kimi 网页端、手机 App、Kimi Work、Kimi Code 和 API。官方同时宣布,完整模型权重将在 2026 年 7 月 27 日前发布。

这可能是过去一年中最值得关注的国产模型发布之一。但与社交媒体上的“全球第一”“全面超越 Claude”等说法相比,K3 的真实位置要复杂得多:它确实在一些重要任务上进入了全球第一梯队,甚至拿到了单项第一;但在综合能力、部署成本、输出效率和产品成熟度上,它仍然没有全面击败最强闭源模型。

不是“综合全球第一”,但前端能力确实登顶了

Kimi K3 发布后传播最广的一项成绩,是在 Arena WebDev 榜单上拿到 1679 分,超过 Claude Fable 5 的1631分和 GPT-5.6 Sol 的1618分,暂列第一。

不过,这项成绩需要放回具体语境中理解。

WebDev Arena 测试的是前端网页开发能力,包括页面设计、交互实现和需要多步工具操作的 Agent 编程任务,并不是覆盖所有知识、推理和编程能力的综合榜单。K3 的1679分目前还带有“Preliminary”标记,意味着样本量和排名稳定性仍有继续变化的可能。

即便如此,这个结果仍然很有分量。过去的模型编程评测往往更看重算法题、代码补全和错误修复,而 WebDev Arena 同时考验代码、视觉审美、布局理解、交互设计和浏览器反馈。K3 在这里领先,说明它不只是“会写代码”,而是开始表现出较强的界面规划和产品实现能力。

一位社区观察者统计称,K3 在 WebDev 榜单的七个细分类别中拿下六个第一,包括品牌营销、参考图还原、数据分析页面等,其排名较 K2.6 从第18位跃升至第1位。国内社区随后出现了大量“一句话生成小游戏”的演示,涉及复古游戏、卡牌界面和交互式数据页面。

这也是 K3 发布初期口碑最集中的部分:它生成的前端作品往往不只是功能可运行,视觉完整度、动画效果和界面层次也比较突出。

但“前端第一”不能被直接改写为“代码能力全面第一”,更不能等同于“综合智能全球第一”。

更准确的位置:开放模型前沿,综合能力仍落后于最强闭源模型

月之暗面在官方材料中没有宣称 K3 已经全面超越 Claude Fable 5 或 GPT-5.6 Sol。相反,官方明确承认,K3 的整体表现仍落后于这两个最强闭源模型。

Artificial Analysis 的独立评测也支持这一判断。Kimi K3 在其 Intelligence Index 中得到57分,属于当前领先模型之一,但总体位置更接近 Claude Opus 4.8 和 GPT-5.5,仍落后于 Fable 5 与 GPT-5.6 Sol。

因此,描述 K3 最准确的方式,并不是“新的全球最强模型”,而是:

它可能是目前最接近闭源能力上限的开放权重候选模型之一,并且在部分真实任务上已经能够击败顶级闭源模型。

K3 在几类任务上的表现尤其突出。

在 BrowseComp 长周期检索评测中,官方公布的成绩为91.2,领先 Fable 5 和 GPT-5.6 Sol;在衡量真实职业知识工作的 GDPval-AA v2 中,K3 得到1687分,位于 Fable 5 Max 和 GPT-5.6 Sol Max 之后;在 AA-Briefcase 私有 Agent 评测中,K3 排名第二,超过 GPT-5.6 Sol Max,仅次于 Fable 5 Max。

编码方面,第三方整理的官方数据包括 DeepSWE 67.5、ProgramBench 77.8、Terminal-Bench 2.1 88.3、FrontierSWE 81.2,以及 SWE Marathon 42.0。这些成绩表明 K3 在终端操作、长期代码任务和软件工程 Agent 场景中非常有竞争力。

但这些数据不能简单横向相加。官方评测表中混合使用了 Kimi Code、Claude Code、Codex 和其他 Agent 框架,不同模型所使用的工具、提示词、上下文管理方式和执行环境并不完全相同。

对于 Agent 模型来说,框架本身就是能力的一部分。同一个基础模型接入不同代码执行器、搜索工具和上下文压缩策略,最终成绩可能出现明显差异。因此,这些结果足以证明 K3 值得进入企业和开发者的候选名单,却还不足以证明它是所有编码任务上的统一最优解。

社区为什么对 K3 如此兴奋?

目前的社区正面评价主要集中在三个方面。

首先是它在真实工作流中的完成度。相比只会给出代码片段的模型,K3 更倾向于持续调用工具、运行程序、检查浏览器结果,再根据反馈修复问题。一项由月之暗面赞助的第三方 KingBench 实测中,K3 得到62/80,综合排名第三,落后于 Fable 5 和 Opus 4.8;但评测者认为,它在长程 Agent 任务、前端动画、SVG、Three.js 和工具使用上表现突出,甚至在部分真实 Agent 工作中优于 Opus 4.8 和 GPT-5.6 Sol。

这项评测带有赞助关系,不能视为完全中立的证据,但它反映的体验与 Arena 前端榜、部分社区演示基本一致:K3 的优势不只在回答单个问题,而在持续执行一整段任务。

其次是模型的能力跨度。K3 原生支持视觉输入,并提供100万 token 上下文,可以同时处理大型代码仓库、长文档、图片、表格和多轮工具历史。官方 API 文档显示,K3 当前始终启用推理,reasoning_effort 暂时只支持 max,未来才会增加较低的思考档位。

这解释了为什么不少用户感觉它“愿意把任务做完”,同时也解释了响应较慢、输出成本较高的问题。

第三是开放权重的预期。如果月之暗面按计划发布完整权重,企业将有机会对 K3 进行私有部署、定制微调和内部评测,不必把所有敏感数据交给外部 API。对于金融、科研、政企和大型软件研发团队,这种可控性有时比每百万 token 的价格更重要。

2.8万亿参数背后,真正值得关注的是架构

单纯把参数量做大,并不必然带来更好的模型。K3 更值得关注的地方,是月之暗面为了支撑这个规模所采用的三组架构设计。

第一组是 Kimi Delta Attention,也就是 KDA。

传统全注意力需要让序列中的 token 彼此计算关联,其计算和缓存压力会随序列长度迅速增长。需要纠正的是,这通常是平方级增长,而不是原稿所说的“指数增长”。

KDA 使用混合线性注意力机制,在需要精确回看的部分保留完整注意力,在其他部分通过更紧凑的状态表示处理历史信息。按照官方数据,在百万 token 场景中,KDA 最高可以带来6.3倍的解码加速。

这并不代表所有请求都会快6.3倍。它主要针对超长上下文,并且实际提升还会受到输入长度、硬件、并行方式和缓存命中率影响。但对于大型代码库和长文档任务,注意力机制的变化可能比参数量本身更重要。

第二组是 Attention Residuals,简称 AttnRes。

传统残差连接会让信息逐层累积,而 AttnRes 允许模型有选择地从不同深度检索表示。简单来说,它不再要求每一层都只依赖紧邻的上一层,而是能够更灵活地找回前面某些层保留下来的信息。

官方称,这一设计以不到2%的额外成本,带来了约25%的训练效率提升。它解决的是模型“深度”方向的信息流动问题,而 KDA 主要解决“序列长度”方向的问题。

第三组是更稀疏的 MoE,也就是混合专家架构。

K3 一共有896个专家,但每个 token 只激活其中16个。这意味着模型拥有巨大的总知识容量,却不需要在每次推理时调用全部2.8万亿参数。配合 Stable LatentMoE、训练方法和数据配方优化,月之暗面称 K3 相比 K2 的整体扩展效率提升了约2.5倍。

因此,2.8万亿是模型的总参数量,不是每生成一个 token 都会完整计算的参数量。把总参数直接等同于推理计算量,会严重高估它的单 token 计算成本。

但另一方面,所有专家的权重仍然需要被存储和调度。MoE 可以降低每一步的计算量,却不会让2.8万亿参数凭空消失。

“开放权重”不等于普通人可以本地运行

原稿认为,K3 开放权重将“极大降低企业自建顶尖模型的门槛”。这个判断需要反过来说。

开放权重降低的是许可、研究和供应商锁定门槛,但 K3 巨大的模型规模会显著抬高硬件和工程门槛。

仅从理论存储量估算,2.8万亿参数以 BF16 保存就需要约5.6TB空间;即使压缩到4bit,也要约1.4TB,这还没有计算路由层、视觉模块、运行时缓存、并发冗余和框架开销。真正高性能部署还需要多机互联、专家并行、负载均衡和专门适配过的推理框架。

社区已经指出,在权重格式、许可证、显存需求和官方部署指南真正公布以前,“能够自建 K3”仍然只是一个假设,而不是已经得到验证的工程结论。

因此,K3 的开放价值主要面向云服务商、大型企业、研究机构和推理基础设施厂商。普通开发者更现实的使用方式仍然是官方 API 或第三方托管服务。

这也构成了 K3 最有意思的矛盾:它可能是目前能力最强的开放权重模型之一,同时也可能是最难自行部署的开放模型之一。

定价争议:国产模型开始放弃“低价替代”叙事

Kimi K3 API 的价格是每百万输入 token 3美元、每百万输出 token 15美元,缓存命中输入价格为0.3美元。

这个定价明显高于人们对国产开放模型的传统预期。

Artificial Analysis 认为,K3 的智能水平属于领先梯队,但与相近模型相比价格偏高。其 Intelligence Index 测试中,K3 一共生成约1.3亿个输出 token,而同类模型平均约为6300万个,完成整套评测花费2690.8美元。

这意味着,评估模型成本不能只看标价。模型是否容易过度推理、一次任务需要生成多少 token、是否会重复调用工具,以及完成任务的成功率,都会影响真实支出。

Reddit 上关于 K3 定价的一则讨论获得了268个赞和117条评论。部分用户认为,3美元输入、15美元输出已经进入前沿模型价格区间,K3 不再是典型的“便宜中国模型”;也有人认为,如果它确实能在一次运行中完成原本需要多次重试的任务,那么较高的单 token 价格仍然可能带来更低的总任务成本。

这个变化或许比参数数字更值得重视。

过去国产大模型在海外市场的典型叙事是“能力接近,但价格便宜很多”。K3 正在尝试另一种路线:能力进入第一梯队后,也争取第一梯队的定价权。

这说明月之暗面不再满足于成为闭源模型的廉价替代,而是希望 Kimi 能够作为独立的前沿模型品牌参与竞争。

当前短板:慢、贵、依赖框架,而且仍需人工验证

K3 发布后的负面反馈,主要集中在效率、稳定性和使用复杂度上。

首先是输出速度和响应等待。Artificial Analysis 测得 K3 的输出速度约为每秒62个 token,不能算非常慢,但在当前模型中只得到2/4的速度评级。由于 K3 目前默认只能使用最大思考强度,简单问题也可能承担较重的推理开销。

其次是输出偏长。Artificial Analysis 的评测中,K3 生成的 token 数量约为同类平均值的两倍。这既可能说明它愿意进行更完整的推理,也可能意味着它在部分任务中过于啰嗦,增加了延迟和费用。

再次是上下文管理要求较高。官方提醒,K3 在后训练中使用了完整思考历史保留模式。如果 Agent 框架没有正确回传历史推理内容,或者用户在同一个会话中途从其他模型切换到 K3,可能造成上下文干扰和质量波动。

这意味着 K3 并不是换上模型名称就能立即发挥最佳能力。SDK、消息结构、思考历史和工具循环都必须正确适配。官方文档也要求开发者把 SDK 返回的完整 assistant message 加入历史,不能只保留文本和工具调用字段,否则可能丢失推理上下文。

最后,社区的早期演示存在明显的幸存者偏差。发布首日,人们更愿意分享成功生成的炫酷网页和小游戏,而失败案例、重复尝试次数、完整提示词、实际花费和人工修改量往往没有同时公布。部分高热度视频还带有官方赞助或推广关系。

因此,目前可以确定的是 K3 的能力上限很高,但还不能根据少量精心挑选的演示,判断它在长期生产环境中的平均成功率。

K3 的真正意义,不只是“又一个更大的模型”

如果只看2.8万亿参数,Kimi K3 很容易被理解为一次规模竞赛。但它真正释放出的行业信号至少有三层。

第一,开放权重模型与最强闭源模型的差距正在从“代际差距”缩小为“任务差异”。K3 并没有全面领先 Fable 5 和 GPT-5.6 Sol,却已经能在前端开发、长周期检索和部分 Agent 任务上正面取胜。

第二,模型竞争正从单轮问答转向完整工作系统。模型能不能调用工具、维护长程状态、运行代码、检查结果并自我修复,越来越比一道数学题或一段代码补全更重要。

第三,国产模型开始争夺高端定价权。K3 的价格并不便宜,但月之暗面显然认为,开放权重、长上下文、复杂任务能力和供应链可控性本身就具有商业价值。

结语:不是“全面登顶”,但已经改变了比较方式

Kimi K3 不是一个已经全面击败 Claude 和 GPT 的模型。

在综合智能、用户体验、效率和产品成熟度上,月之暗面自己也承认,它仍然落后于最强闭源模型。它的部分官方评测使用了不同 Agent 框架,开放权重也尚未在发布当天兑现,社区反馈仍处于早期且偏向成功案例。

但如果因此认为 K3 只是一次参数营销,同样会低估它。

它在 WebDev Arena 中取得第一,在长周期检索和知识工作评测中进入前列,并通过 KDA、Attention Residuals 和高稀疏 MoE 尝试解决超长上下文与超大规模模型的效率问题。更重要的是,它证明开放模型不再只能依靠“便宜”和“够用”参与竞争,而是开始在少数核心任务上直接争夺最强位置。

所以,Kimi K3 更像是一个分界点,而不是终点。

在它之前,人们讨论的是开放模型还要多久才能追上闭源模型;在它之后,更有意义的问题可能变成:对于某一个具体任务,开放模型是否已经是更好的选择?

真正决定 K3 历史位置的,也不是发布当天的排行榜,而是7月27日之后的权重、许可证、第三方部署结果,以及未来几个月真实生产环境中的成功率和成本。

在这些数据出现以前,最稳妥的结论是:

Kimi K3 尚未全面登顶,但开放模型第一次如此清晰地触碰到了闭源前沿。

标签: Kimi K3, AI

评论已关闭