Kimi K3 实测:开源3万亿参数模型,免费用户现在就能用上

9 月 16 日,月之暗面发布了 Kimi K3。数据先摆出来:2.8 万亿参数,MoE 架构,激活 16/896 个专家,上下文窗口 100 万 token,原生支持图像和视频理解。更关键的是,这是一个开源模型(Kimi K3 License),权重已经放出来了。

放一年前,这些数字跟普通人没什么关系——你总不可能在自己电脑上跑一个 2.8T 的模型。但 Kimi 把 K3 直接接进了 kimi.com 的网页版和 App,网页版现在登录就能用。我这两天拿它干了几件日常的活,这篇说说真实感受,以及普通用户到底要不要关心这个「全球首个开源 3 万亿级模型」。

先交代信息来源,免得你说我瞎吹:发布信息来自 Kimi 官网博客和 Moonshot 官网,模型细节来自 Kimi 开放平台文档(platform.kimi.com)和 GitHub 上的 MoonshotAI/Kimi-K3 仓库,都是官方一手信息。至于「官方宣传的性能数据」,我保持一贯态度:看看就好,自己用着顺不顺手才是真的。

网页版怎么用上 K3

打开 kimi.com,新建对话,模型切换到 K3 就行,不用充值不用订阅。注意一点:K3 是「始终思考」的模型,回答前会先推理一截,所以出结果比普通模式慢几秒到十几秒。简单问题你感知不到差别,复杂问题这个等待是值的。

API 那边的情况是:K3 是旗舰模型,开放平台充值后才能调用(最低充 10 块),新用户注册送的 15 块代金券不能用于 K3。API 模型名是 kimi-k3,兼容 OpenAI SDK,推理强度分 low/high/max 三档,默认 max。自己折腾 API 的朋友记一下。

实测:三件事,三种感受

第一件:读一份 180 页的招股书

这是 K 系列的老本行,我拿一份之前看过的招股书 PDF 喂进去,让它梳理商业模式、营收结构和风险因素。

结果:结构清楚,风险因素那部分它自己标了「招股书原文表述较模糊」——这是我比较意外的,它没有硬编。数字引用我抽查了六七处,都对得上原文。以前用小参数模型干这事,偶尔会把两页的数字张冠李戴,这次没出现。

代价是慢。整份读完花了五六分钟,中途还停下来「思考」了两次。赶时间的话这体验不算好,但准确性面前我愿意等。

第二件:代码 debug + 一次重构

给了它一段我故意留了坑的 Python 数据处理脚本,大概 200 行。三个 bug:一个边界条件、一个类型转换、一个并发写文件的隐患。全部找出来了,并发那个还给了两种修法并说了取舍。

重构那单我让它把一个 400 行的 God Function 拆开。拆得干净,依赖也理顺了。但我没让它直接上主分支——AI 重构的东西,测试必须自己跑一遍再合,这习惯别丢。

官方宣传里 K3 的「长程编程」是指它挂着工具连续干几小时的那种场景(比如在 GitHub 仓库里连续开发),那需要 Kimi Code 这类环境配合,日常在网页版用不到那么深。就网页版这种对话式用法,它的代码水平在我用过的模型里属于第一梯队。

第三件:写一段小红书文案

翻车了。给了一个比较具体的产品场景让它写小红书文案,产出结构工整、信息也对,但那种「工整」本身就是问题——每段差不多长,句式太均匀,一看就是 AI 写的。我又追问了两轮,让它「写得随便点」「加点个人抱怨」,才有那么点人味。

结论跟我之前测各家模型时一致:越「聪明」的模型,默认输出越端着。创意写作类任务,别指望开箱即得,得多调教几轮。

100 万 token 上下文,普通人用得上吗

直说:大多数日常场景用不上。你跟 AI 聊天、写周报、改简历,几千 token 就打住了。100 万 token 是给「把整个项目代码库丢进去」「几十份文档一起分析」这种事准备的。

但它有个隐性好处值得知道:长对话不容易「失忆」。以前聊到上百轮,模型开始忘开头说过的设定;上下文窗口大了,这类翻车会少很多。所以哪怕你永远用不满 100 万,它也在默默改善你的体验。

跟 K2.5 什么关系,老用户要换吗

K2.5 是今年 8 月开源的多模态模型(1 万亿参数,256K 上下文),K3 是它的全面升级:参数 2.8 倍,上下文 4 倍,架构更新(Kimi Delta Attention + 注意力残差)。官方说扩展效率比 K2 提升约 2.5 倍。

网页版用户不用纠结,直接用 K3 就行。有个细节提醒:官方博客原话是 K3「整体性能仍落后于最强的闭源模型」,这种自己承认差距的表态我反而觉得可信度高些——满嘴「遥遥领先」的才要小心。

该说什么了:值不值得用

三个结论:

一,免费用户现在就能在 kimi.com 用到开源阵营的最强模型,这在一年前是不可想象的事,白嫖党没有理由不用。

二,长文档分析、复杂代码这类「深度活」,K3 跟免费小模型的差距是实打实的,值回那几秒等待。轻量闲聊用谁家都行。

三,写文案别指望它开箱即得,多调教。

最后说个我自己的感受:从年初到现在,「开源模型追平闭源第一梯队」这句话说了很多次,大部分时候是营销话术。但看着 K2(1T)到 K2.5(1T 多模态)再到 K3(2.8T)这条线,开源阵营这次是拿参数规模和架构创新硬怼上去的,权重真放出来了,谁都能下载验证。作为用户我不关心厂商的口水仗,我只知道我免费用的模型越来越强了——这就是开源竞争给我这种普通用户带来的实利。

发表评论