我宣布,Kimi 正式 和 DeepSeek 一桌,成了开源界的真·活菩萨。
因为昨天晚上,Kimi K3 正式在 Hugging Face 上开源了。

半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。

而且 Kimi 这次开的东西也不简单,除了模型的权重文件本身之外,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。

这下是和 DeepSeek 一样,是真把焚诀给差友们掏出来了。
各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。
可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。

而且本身自带多模态功能,没有啥短板。
模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。
而且不光总参数大,模型的激活参数也是大的离谱,

在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源的模型本体都要大了。
为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。

首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。
而 Kimi 这次为了节省算力,采用了一种叫做混合注意力的办法,信息过来,首先要过一层 KDA ( Kimi Delta Attention ),KDA 会一边读取文本,一边把关键信息写进一个持续更新的状态里。
新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。
同时为了防止 KDA 漏掉关键信息,Kimi 还在三层 KDA 后安排了个 Gated MLA,相当于是让模型做了几页笔记后,再回头翻下原文检查一下。

通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。

除此之外,Kimi 还设计了 Attention Residuals 注意力残差连接,来减少信息在传递时的丢失。
又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。
还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。
避免有人天天 996,有人天天摸鱼的情况发生。
通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。

而 Kimi K3 的发布和开源,也已经不是技术小圈子的自嗨了。
它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。
比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。
Kimi 的员工也漂亮反讽,说 Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。 难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?

我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。
另外,美国政府在前不久,也准备制裁调查咱国家的人工智能企业。
咱们的商务部也是完美还击。

另外一边,高情商的老黄也注册 X ,发了公开信阐述开源的重要性,还拉了微软、谷歌、OpenAI 等等近快 100 家科技巨头联名。
公开反对封禁中国的开源模型。

压力之下,坚定的闭源主义战士 Anthropic 则又又又发了小作文,说哎呀,我们不抵制开源,只是怕强大的模型落在坏人的手里。
说实话,这次,开源模型能这么快的逼近这些世界顶级的闭源模型,还是蛮让人意外的。。。
差评君还记得第一次看到 Mythos 和 Fable 时的样子,虽然 Anthropic 这家公司天天不干好事,但是人做的模型确实是有两把刷子。

在那个时候,大家普遍以为开源模型和闭源模型的差距会越来越大。
因为这两个类模型在进行的,是一场完全不对等的赛跑。
闭源模型可以随意的学习开源模型的技术,就比如 DeepSeek 就曾经一把屎一把尿的教会了大家,如何让模型学会推理思考。
可是反过来,开源模型却不能从闭源模型那边学到些什么。
但好在,开源模型和开源模型之间,还是有不少互相学习、互相抬轿子的机会的。
翻开这次 Kimi 的论文就会发现,它的眼里都是 DeepSeek 的影子。

从多头注意力 MLA、混合专家模型 MoE,到训练稳定性和推理效率,很多技术里,都藏着开源社区过去几年的积累。
但 Kimi 也没有简单照抄,而是在这些基础上,继续做出了 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 这些新东西。
开源社区里的这股互相学习,互相致敬的风气,才是开源模型最宝贵的东西。
上一代模型留下的经验,会直接变成下一代模型的起点。
这些开源模型就这样互相借力,一层一层地往上搭,硬生生追上了那些掌握着更多算力、资金和数据的闭源巨头。
感谢这些开源模型持续不断的努力,至少现在 K3 发布后,已经没人会说 “ 开源模型会越来越落后 ” 这样的爆论了。
而 AI 的发展,也已经不再是公司与公司、开源与闭源之间的冲突了。它不仅和技术平权相关,还和国家安全、地缘政治等等都脱不开关系。
也希望未来,国内有越来越多像 K3 这样的优秀模型。
毕竟讲道理当然有用,但很多时候,摆实力更好使。
💡 网购省钱小技巧
下单前先查历史价格,再领隐藏优惠券,还能享受购物返利,让每一次购物都更划算。
麦享科技

麦享生活微信小程序   麦享生活微信公众号