文 | 字母AI

Kimi K3开源这事儿一出来,“部署大模型”瞬间成了全网焦点。

全球性能排名第三,还能免费下载,这诱惑力谁顶得住?

但网上流传最广的说法很现实:想自己搞定K3,得准备3000万人民币买设备。毕竟K3总参数高达2.8万亿,光权重文件就占了1.4TB到1.5TB,实际显存需求更是突破2TB。

所以,Kimi官方建议是,至少得配一个拥有64张加速卡的超节点才能跑起来。按目前主流的B200型号算,单卡约40万,64张显卡总价就是2560万。这还不算场地问题,普通居民楼楼板根本扛不住这么重的设备,还得专门建机房,加上设备运行和液冷系统的电费。说句大白话,要是你真铁了心要自己跑K3,前期投入起码得两辆劳斯莱斯幻影起步。

即便你神通广大,真把设备都凑齐了,想亲自部署K3也绝非易事。后面等着你的还有电费、散热、模型调优、运维等一堆麻烦事,每一项都是不小的开销。

况且,除了K3,国产开源大模型还有一堆猛将,比如DeepSeek V4-Pro、GLM-5.2、Qwen 3.8,个个都是千亿甚至万亿参数的选手。那它们的部署成本又几何呢?

开源大模型到底有多大?

其实“普通人想自己跑大模型”这个念头不是最近才冒出来的,只是因为K3太火,才被各大媒体重新翻炒了一遍。

早在DeepSeek V3发布时,关于普通人如何部署大模型的讨论就已经很热烈了。

2024年底,DeepSeek V3以6710亿总参数、370亿激活参数的MoE架构开源,训练成本仅557万美元,性能却能与Claude 3.5 Sonnet掰手腕。

一时间,知乎、B站、公众号里全是“手把手教你本地部署DeepSeek V3”的教程。

有人用RTX 4090硬扛,有人把家里电表跑跳闸,甚至不懂技术的亲戚都在问“DeepSeek是啥,咋用”。

那阵仗,像极了当年比特币行情启动时,人人都在聊笔记本挖矿的日子。

热闹归热闹,真要完整跑起V3,推荐配置是8张H100或A100。H100单卡官方定价3.65万美元,折合人民币约26万;A100稍便宜,单卡约10.8万人民币,8卡整机也要80万以上。要知道,高配版宝马X5、奔驰GLE、奥迪Q7落地价才70多万。

另外,网上那些“RTX 4090本地部署”教程,跑的是量化到面目全非的4位精度阉割版。输出答案质量低不说,还有严格字数限制,一旦超过几百字,模型就会崩溃。

普通人和千亿参数之间的距离,远比教程里写的“5分钟搞定”要遥远得多。

到了2026年,局面更夸张。

2026年4月24日发布的DeepSeek V4-Pro,总参数1.6万亿,MIT协议开源,权重在Hugging Face免费下载。

哪怕用FP8精度量化,权重文件也得1.6TB起步。要把它完整装进显存,至少需要16张H200。H200单卡141GB显存,16张合计2.2TB,扣掉KV缓存和系统开销,刚好够用。

H200英伟达官方定价为单颗2.7万美元,折合人民币约19万,但国内报价23.5万,8卡整机报价188万,16张就是376万。

再看2026年6月17日智谱开源的GLM-5.2,总参数约7530亿,激活参数更小。同样只需8张H200就能跑得动。

最后是Qwen 3.8。2026年7月19日阿里发布预览版,总参数2.4万亿,承诺即将开放权重。

要完整装下2.4万亿参数,H200的141GB显存已经不够看,得上B200,单卡192GB显存,64张B200合计12.3TB,才能撑住这个体量。换句话说,部署Qwen 3.8,也得跟前面提到的K3一样,准备3000万。

事情到此还没完,甚至这才刚开始,显卡只是第一笔账,接下来是电费。

以Qwen 3.8的64张B200为例。B200单卡TDP是1000W,液冷版能拉到1200W。64张卡满载就是64千瓦到77千瓦,再加上CPU、网络交换机、散热泵等周边功耗,整机柜轻松突破80千瓦。

一台1.5匹家用空调制热功率大概1200W,一张B200就快赶上一台空调了。64张B200满载运行,相当于同时开50多台空调,顶得上半栋居民楼的用电量。

按工业用电每度0.8元算,80千瓦满载运行,每天电费就是1536元,一年56万。这还是不停机的情况,大模型推理服务器一旦上线,基本就是7×24小时运转,没有“关机省电”这个选项。

电的问题说完了,热的问题紧跟而来。

B200单卡1000W的功耗,意味着传统的风冷散热根本压不住。

英伟达官方表示,B200的SXM版本从设计之初就是奔着液冷去的,风冷版本性能上限只有18PFLOPS,液冷版本能跑到20PFLOPS。

而液冷设备又可以分为两种,第一种是英伟达认证,市场价格大约每一机柜15-20万人民币,第二种是非英伟达认证,大约每机柜8-15万。

空间也是个问题。一台标准的8卡HGX服务器,高度为6U到8U,U是机架单元标准,1U为44.45毫米,因此高度可以理解为0.267米-0.356米。

然后裸机普遍75–120公斤,满配、带导轨/线缆/PDU,整机通常超过90公斤。但一个机柜底座面积很小,通常为0.36平方米。普通住宅的均匀活荷载为200公斤每平方米,这就意味着,一个机柜的局部压强,远高于民用常规设计,因此没办法放进普通住宅之中。

此外,这种设备对环境温度、湿度、灰尘也有严格要求,若无法严格管控,会有包括冷却液外露等风险。

最后还有运维。大模型部署不是“装个软件”这么简单。

模型权重加载、推理框架调优、KV缓存策略配置、监控告警、日志排查、故障恢复,每一个环节都需要专业工程师。至少需要一个3到5人的小团队。按目前行情,一个合格的AI基础设施工程师年薪30万起步,一个小团队一年的人力成本就要超过百万。

钱不能解决所有问题

价格只是一方面,接下来这些,才是真正让人感到无力的部分。

英伟达的高端卡对中国有出口管制,这不是什么新闻了。

美国工业与安全局(BIS)明确规定,基于Blackwell架构的B200、B300以及下一代Rubin系列芯片,在国内发布后至少18到24个月内仍严格禁止向中国出口。

好在的是,由于咱们只是拿模型跑,而不是训练大模型,所以只需要考虑GPU的推理能力就行。而推理这件事,国产AI芯片同样也能干。

但话又说回来了,能跑是一回事,好不好用是另一回事。英伟达的CUDA生态经过十几年积累,全球开发者几百万,Stack Overflow上你能搜到的答案浩如烟海。

但是在国产AI芯片这边,虽然DeepSeek V4做到了全栈国产化训练,8大国产芯片厂商也都做了Day 0适配,Kimi也宣布在未来能跑在国产卡上,但这是DeepSeek和Kimi官方团队的工程能力。

你一个民间玩家拿到国产卡,CUDA上一天能跑通的东西,国产卡上你得等一段时间才能拿到适配。出了报错,你没办法到Stack Overflow上找答案。

软件生态的差距,比硬件性能的差距更让人绝望。硬件慢,你可以等;软件跑不通,你连等的资格都没有。

退一万步说,就算你路子野,搞到了卡,搞定了液冷,扛住了电费,养起了团队,把模型跑起来了——然后呢?

你拿这套东西和官方API比一比就会发现,99%的公司自建永远不回本。

我们拿DeepSeek V4-Pro的最低配方案来算一笔账。

DeepSeek V4-Pro的API定价,输入每百万token 3元(缓存命中仅0.025元),输出每百万token 6元,还首创了“峰谷分时计费”,谷时算力费直降60%。

不考虑峰谷的差价,假设你团队每天调用5000万token,其中输入3500万、输出1500万,这已经是一个相当高频的使用量了。

输入费用为35×3=105元/天;输出费用为15×6=90元/天。每天合计不到200块钱,一年约7万。

前面说了,16张H200光显卡就是376万,加上液冷改造30万、电力增容和场地改造30万,硬件首年投入约436万。

再算运维,一个小团队一年人力百万,电费按16张 H200满载约11.2千瓦、24小时运转,整台服务器还要算 CPU、内存、硬盘、风扇,加上数据中心PUE,实际取电功耗大概在15-20千瓦左右。按工业用电1元/度算,一年电费应该在13万到18万之间。

也就是说,不算硬件折旧,光是“养”这套系统,每年就要烧掉120多万。硬件按5年折旧,合计自建每年成本超过200万。

大模型推理成本的核心逻辑是模型规模越大,推理越贵,然而API厂商靠规模效应摊薄成本的能力,远超任何单一企业。

DeepSeek、Kimi、阿里这些厂商,一张GPU上跑着几百个用户的请求,批处理、KV缓存复用、投机解码、动态路由,每一项技术都在榨干每一滴算力。

Kimi K3靠着缓存命中率超过90%,命中后输入成本仅为标准价的四分之一。你自己部署,一张卡就伺候你一个用户,GPU利用率可能连10%都到不了。

老老实实用API,不丢人。

你下载的模型和官方的模型是两回事

就算你路子野,搞到了所有需要的设备,而且你花了好几个通宵终于成功地在你自己的设备上部署了想要的大模型。

那么恭喜你,你跑出来的那个东西,和官方API里的那个东西,压根不是同一个物种。

为什么?因为你能下载到的,只是权重文件。

权重文件是模型的“记忆”。模型在训练过程中学到的一切,比如语言规律、知识、逻辑、甚至某种程度上的“常识”,全都以数字的形式存在这些权重里。

然而模型权重不是一个数据库,它是大模型理解问题的方式,你可以把模型权重理解成为一个“分量”。

怎么判断一张照片里是不是猫?可能会看脸、有没有胡子、身上有没有毛、有没有尾巴……

脸是最重要的,猫科动物的脸长得都差不多,但是有没有尾巴和有没有毛就不那么重要,很多动物都有尾巴和毛。

不同特征的重要程度(权重)就是它在大模型中的分量。

但一个模型从“权重文件”变成“好用的 AI 服务”,中间隔着一整套你拿不到的工程。

首先是推理优化框架。

DeepSeek官方跑DSpark投机解码,靠半自回归生成和置信度调度验证,在不损失质量的前提下把推理速度提升51%到85%;Kimi有自研的Mooncake架构分离式推理。

这些框架对模型的结构做了深度定制优化,知道哪个专家该走哪条路径,哪个层可以做算子融合,哪些计算可以跳过。

你拿到的权重文件只是一个“裸”的模型,性能和官方的差出一个数量级都不稀奇。

然后是KV缓存策略。

大模型每生成一个字,都要把前面所有的内容重新“理解”一遍,这个中间结果叫KV缓存。

官方服务会管理这些缓存,比如多个用户问了相似的问题,那么这些缓存就可以复用;高频请求的内容,缓存提前预热;内存紧张时,哪些缓存该淘汰、哪些该保留,全有精细的路由算法。

Kimi K3靠着缓存命中,命中率超过90%,命中后输入成本直接降到标准价的四分之一。

你自己跑,没有这套缓存策略,每个请求都从零开始算,慢且贵。

还有动态批处理。

官方服务会把不同用户的请求动态打包成一个batch,一次性丢给GPU处理,GPU的并行计算能力被压榨到极致。你自己一个人用,一次就一个请求,GPU 99%的算力在空转。

这就好比你买了一辆大巴车,却只有你一个人坐,油钱一分不少,座位空了95%。

推理优化、KV 缓存策略、动态批处理、路由算法,这些真正决定体验的东西全是闭源的。

就像餐厅把菜谱给你了。菜谱上写着用多少盐、放多少酱油、几成热油下锅。你照着做,能做出一盘能吃的菜。

不说别的,可口可乐的配料就写在瓶子上,有谁能拍着胸脯说它能在可口可乐的价格之内完美复刻可口可乐的味道呢?

模型也一样。自己下载的权重,和官方API里跑的那个模型,虽然参数一模一样,但背后的推理框架、缓存策略、批处理优化、路由调度,差了十万八千里。你问它同一个问题,官方的回答又快又好,你的又慢又有幻觉。

所以,得稍微掂量掂量自己的实力再考虑部署。

如果是企业,有数据合规需求、有数据安全要求、有定制化微调的需要,那确实有自建的理由,但那是企业级的事,有专门的团队、专门的预算、专门的机房。

如果只是普通老百姓,看着开源模型免费下载就心动了,想在家里搞一套“自己的AI”。那我觉得还是省省吧。

一个月99块钱,买个Moderato级别的Kimi订阅,就能用上全球第三的模型。

开源是好事,但开源不等于“免费部署”。

从入门到放弃,这才是老百姓部署开源大模型的真实距离。