📄 文章总结:《Kimi K3 正式公布焚诀,这下它真成活菩萨了?》
公众号: 差评X.PIN | 分类: LLM | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/SNJLWErLUFsvPXQdIuaYQg
一、Kimi K3 正式开源,开源界的“活菩萨”
文章开篇宣布:Kimi 正式和 DeepSeek 一桌,成了开源界的真·活菩萨。昨晚,Kimi K3 正式在 Hugging Face 上开源,半小时内就拿下 4000 赞,可以说是有史以来最被人关注的开源模型,估计有不少老外和差评君一样掐点等着。Kimi 这次开的东西不简单——除了模型权重文件本身,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。这下和 DeepSeek 一样,是真把“焚诀”给掏出来了。
二、跑分、定位与超大参数
各种跑分测试基本不多说,K3 各项跑分都只低于 Fable 5 和 GPT-5.6 Sol,可以说是世界第三的模型,而且是 TOP 3 里唯一一个可以下载到本地自己运行、自己微调的模型。模型本身自带多模态功能,没有啥短板。K3 模型总参数直接干到了 2.8T,成为最大的开源模型。不光是总参数大,激活参数也大得离谱:在实际干活时,K3 能直接激活 1042 亿参数,数量是上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源模型的整体都要大了。
三、架构创新:KDA、Gated MLA、Attention Residuals 与 Stable LatentMoE
为了驾驭夸张的数据量,K3 做了很多架构上的创新,而且没有藏私,直接写在技术报告里。传统注意力机制下,模型每读一个新词,需要把它和前面所有 token 都计算一遍,读进去内容增长一倍,算力开销就增长四倍。Kimi 采用混合注意力:信息先经过一层 KDA(Kimi Delta Attention),KDA 一边读取文本,一边把关键信息写进一个持续更新的状态里;新内容进来后,它还会判断哪些旧信息需要保留、哪些可以慢慢忘掉。为了防止 KDA 漏掉关键信息,Kimi 在每三层 KDA 后安排一个 Gated MLA,相当于让模型做了几页笔记后,再回头翻一下原文检查。这套组合拳大幅降低了超长上下文的计算成本。此外,Kimi 设计了 Attention Residuals 注意力残差连接,减少信息传递时的丢失;又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理,还给专家安排了限流和排班机制,压住异常激活值、合理分配任务,避免有人天天 996、有人天天摸鱼。
四、训练效率大幅提升
通过这些架构、数据和训练方法的共同升级,K3 在总参数变大的情况下,训练效率反而比上一代 K2 提升了 2.5 倍。
五、开源引发的行业与政治风波
Kimi K3 的发布和开源,已经不限于技术小圈子的自嗨,它像导火索一样把各路好人坏人、牛鬼蛇神都炸出来了。有美国政客指控 K3 是蒸馏美国大模型整出来的;Kimi 员工漂亮反讽:“Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。”另外,美国政府在前不久也准备制裁调查中国人工智能企业,中国商务部则完美还击。高情商的老黄注册 X,发公开信阐述开源重要性,还拉了微软、谷歌、OpenAI 等等近快 100 家科技巨头联名,公开反对封禁中国的开源模型。压力之下,坚定的闭源主义战士 Anthropic 又又又发小作文,说:“我们不抵制开源,只是怕强大的模型落在坏人手里。”
六、开源模型与闭源模型的赛跑,以及开源社区的价值
差评君回忆,第一次看到 Mythos 和 Fable 时,虽然 Anthropic 这家公司天天不干好事,但模型确实有两把刷子。那时候大家普遍以为开源模型和闭源模型的差距会越来越大,因为这两类模型进行的是完全不对等的赛跑:闭源模型可以随意学习开源模型的技术,比如 DeepSeek 就曾经一把屎一把尿地教会大家如何让模型学会推理思考;反过来,开源模型却不能从闭源模型那里学到什么。好在开源模型之间还是有不少互相学习、互相抬轿子的机会。翻开 Kimi 论文会发现,它眼里都是 DeepSeek 的影子——从多头注意力 MLA、混合专家模型 MoE,到训练稳定性和推理效率,很多技术里都藏着开源社区过去几年的积累。但 Kimi 并没有简单照抄,而是在这些基础上继续做出 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 这些新东西。开源社区这种互相学习、互相致敬的风气,才是开源模型最宝贵的东西:上一代模型留下的经验,会直接变成下一代模型的起点。这些开源模型就这样互相借力、一层一层往上搭,硬生生追上了那些掌握着更多算力、资金和数据的闭源巨头。
七、结语与希望
感谢这些开源模型持续不断的努力。至少现在 K3 发布后,已经没人会说“开源模型会越来越落后”这样的爆论了。AI 的发展也已不再是公司与公司、开源与闭源之间的冲突,它不仅和技术平权相关,还和国家安全、地缘政治等等脱不开关系。希望未来国内有越来越多像 K3 这样的优秀模型——毕竟讲道理当然有用,但很多时候,摆实力更好使。
(文末标注:撰文:江江 & 早起;编辑:江江 & 面线;美编:焕妍;图片、资料来源:K3 开源文件 x)
🎯 Friday 提炼
- Kimi K3 正式开源,半小时 4000 赞,成为 TOP 3 模型中唯一可本地下载、运行和微调的开源模型。
- 总参数 2.8T,激活参数 1042 亿,是最大开源模型;通过 KDA、Gated MLA、Attention Residuals、Stable LatentMoE 等创新,训练效率反比 K2 提升 2.5 倍。
- 发布后引发国际风波:被指控“蒸馏”、美国拟制裁、商务部反击,黄仁勋联合近百家科技巨头公开反对封禁中国开源模型。
- 开源社区“互相学习、互相致敬”是宝贵风气,Kimi 吸收了 DeepSeek 等开源积累,又做出新架构创新,硬生生追平欧美闭源巨头。
- AI 竞争已从技术之争延伸至国家安全与地缘政治,“讲道理有用,但摆实力更好使”。
一句话: Kimi K3 开源既是技术“焚诀”公开,也是开源模型追平闭源模型的标志性事件,背后更是一场牵涉政治、安全与地缘竞争的硬仗。
💡 Friday 看法
开源确实是好事,但 2.8T 总参数、1042 亿激活参数这种规模,普通个人开发者基本只能看着,真正能用起来的还是大厂或富哥实验室。比起权重,我更在意那套训练工具和技术报告,这才是社区能接力往前跑的东西。另外,政治戏码看看就好,别把开源模型捧成救世主,好用才是硬道理。