Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/7/31 07:15:15

没两辆劳斯莱斯幻影,别想部署开源大模型

AI 中文解读
开源大模型又炸场了!Kimi K3全球性能第三、免费下载,但想自己部署?先准备3000万人民币,约等于两辆劳斯莱斯幻影。原因很简单:K3总参数高达2.8万亿,光显卡就得花2560万,还不算机房、电费和运维。更扎心的是,这么贵的设备,普通居民楼的地板根本承受不住,必须专门建机房。除了K3,DeepSeek V4-Pro、GLM-5.2、Qwen 3.8这些国产开源大模型,个个都是万亿级参数,部署成本动辄几百万到几千万。就算硬件到位,电费也能吓死人——64张显卡满载运行,相当于同时开50多台空调,一年电费56万。此外,高端显卡对中国还有出口管制,想买都买不到。所以啊,网上那些“RTX 4090手把手部署教程”,跑的都是阉割版,输出质量差还容易崩溃。对普通人来说,想自己跑大模型基本是奢望,平时用用网页版、API接口就够了,真正能负担得起的只有大公司和科研机构。
(本文作者为 字母AI,钛媒体经授权发布)文 | 字母AI自打Kimi K3开源后,“部署大模型”突然成了网上热议的话题。全球性能第三,免费下载。这谁看了能不心动?可是根据网上流传最广的说法,想要自己搞定K3,大约需要3000万人民币来买设备。毕竟K3总参数2.8万亿,光是权重文件就达到了1.4TB到1.5TB,实际需要显存更是超过2TB。因此,Kimi官方给出的建议是,至少需要一个64张加速卡的超节点才能自己部署Kimi K3。按现在的主力型号B200算,一张卡约为40万人民币,64张光显卡就是2560万。普通的居民楼地板也没办法承载这么重的设备,还得考虑专门建个机房,再加上得设备运作以及配套液冷设备的电费。这么说吧,如果你真铁了心想自己跑Kimi K3,前期投入打底两辆劳斯莱斯幻影。然而就算你手眼通天,真的能自己搞定所有设备,想要亲自部署Kimi K3也绝非易事,因为后面等着你的,还有电费、散热、模型调优、运维等等,每一件都是一笔不菲的开销。并且,除了K3,国产开源大模型还有很多,比如DeepSeek V4-Pro、GLM-5.2、Qwen 3.8,个个都是千亿甚至万亿参数级别的选手。那它们的部署成本又是多少呢?开源大模型到底有多大?其实“普通人想自己跑大模型”这件事,不是最近才有的,只是因为K3太出圈,才再次被各大媒体平台重新提起来而已。早在DeepSeek V3发布那会儿,就已经有许多人讨论普通人如何部署大模型了。2024年底,DeepSeek V3以6710亿总参数、370亿激活参数的 MoE 架构开源,训练成本才557万美元,性能却比肩 Claude 3.5 Sonnet。一时间,知乎上、B 站上、公众号里,铺天盖地全是“手把手教你本地部署DeepSeek V3”的教程。有拿RTX 4090硬扛的,有把家里电表跑跳闸的,甚至有不谙技术的七大姑八大姨都在问“DeepSeek 是什么,怎么用”。那阵势,像极了当年比特币行情启动时,人人都在聊怎么用笔记本挖矿。但热闹归热闹,真要把V3完整跑起来,推荐配置是8张H100或A100。H100单卡官方定价3.65万美元,折合人民币约26万,A100便宜些,单卡约10.8万人民币,8卡整机也要80万往上。要知道,高配版的宝马X5、奔驰GLE、奥迪Q7,落地也才70多万。还有,网上那些所谓的“RTX 4090本地部署”教程,跑的是量化到面目全非的4位精度阉割版。输出的答案不仅质量低,而且还有严格的字数限制,一旦超过几百个字,模型就会瞬间崩溃。普通人和千亿参数之间的距离,远比教程里写的“5分钟搞定”要遥远得多。到了2026年,局面就更夸张了。2026年4月24日发布的DeepSeek V4-Pro,总参数1.6万亿,MIT协议开源,权重放在Hugging Face上免费下载。哪怕用FP8精度量化,权重文件也得1.6TB起步。要把它完整装进显存,至少需要16张H200。H200单卡141GB显存,16张合计2.2TB,扣掉KV缓存和系统开销,刚好够用。H200英伟达官方定价为单颗2.7万美元,折合人民币约19万,但是国内报价23.5万,8卡整机报价188万,16张就是376万。再看2026年6月17日智谱开源的GLM-5.2,总参数约7530亿,激活参数更小。同样也只需要8张H200就能跑得起来。最后是Qwen 3.8。2026年7月19日阿里发布预览版,总参数2.4万亿,承诺即将开放权重。要完整装下2.4万亿参数,H200的141GB显存已经不够看了,得上B200,单卡192GB显存,64张B200合计12.3TB,才能撑住这个体量。换句话说,想要部署Qwen 3.8,也得跟前面提到的K3一样,准备3000万。然而事情到此还没完,甚至它还只是刚刚开始,显卡只是第一笔账。接下来是电费。以 Qwen 3.8的64张 B200为例。B200单卡TDP是1000W,液冷版能拉到1200W。64张卡满载就是64千瓦到77千瓦,再加上CPU、网络交换机、散热泵等周边功耗,整机柜轻松突破80千瓦。一台1.5匹家用空调制热功率大概1200W,一张B200就快赶上一台空调了。64张 B200满载运行,相当于同时开50多台空调,顶得上半栋居民楼的用电量。按工业用电每度0.8元算,80千瓦满载运行,每天电费就是1536元,一年56万。这还是不停机的情况,大模型推理服务器一旦上线,基本就是7×24小时运转,没有“关机省电”这个选项。电的问题说完了,热的问题紧跟而来。B200单卡1000W的功耗,意味着传统的风冷散热根本压不住。英伟达官方表示,B200的SXM版本从设计之初就是奔着液冷去的,风冷版本性能上限只有18PFLOPS,液冷版本能跑到20PFLOPS。而液冷设备又可以分为两种,第一种是英伟达认证,市场价格大约每一机柜15-20万人民币,第二种是非英伟达认证,大约每机柜8-15万。空间也是个问题。一台标准的8卡HGX服务器,高度为6U到8U,U是机架单元标准,1U为44.45毫米,因此高度可以理解为0.267米-0.356米。然后裸机普遍75–120公斤,满配、带导轨/线缆/PDU,整机通常超过90公斤。但一个机柜底座面积很小,通常为0.36平方米。普通住宅的均匀活荷载为200公斤每平方米,这就意味着,一个机柜的局部压强,远高于民用常规设计,因此没办法放进普通住宅之中。此外,这种设备对环境温度、湿度、灰尘也有严格要求,若无法严格管控,会有包括冷却液外露等风险。最后还有运维。大模型部署不是“装个软件”这么简单。模型权重加载、推理框架调优、KV 缓存策略配置、监控告警、日志排查、故障恢复,每一个环节都需要专业工程师。至少需要一个3到5人的小团队。按目前行情,一个合格的AI基础设施工程师年薪30万起步,一个小团队一年的人力成本就要超过百万。钱不能解决所有问题价格只是一方面,接下来这些,才是真正让人感到无力的部分。英伟达的高端卡对中国有出口管制,这不是什么新闻了。美国工业与安全局(BIS)明确规定,基于Blackwell架构的B200、B300以及下一代Rubin系列芯片,在国内发布后至少18到24个月内仍严格禁止向中国出口。好在的是,由于咱们只是拿模型跑,而不是训练大模型,所以只需要考虑GPU的推理能力就行。而推理这件事,国产AI芯片同样也能干。但话又说回来了,能跑是一回事,好不好用是另一回事。英伟达的CUDA生态经过十几年积累,全球开发者几百万,Stack Overflow上你能搜到的答案浩如烟海。但是在国产AI芯片这边,虽然DeepSeek V4做到了全栈国产化训练,8大国产芯片厂商也都做了Day 0适配,Kimi也宣布在未来能跑在国产卡上,但这是DeepSeek和Kimi官方团队的工程能力。你一个民间玩家拿到国产卡,CUDA上一天能跑通的东西,国产卡上你得等一段时间才能拿到适配。出了报错,你没办法到Stack Overflow上找答案。软件生态的差距,比硬件性能的差距更让人绝望。硬件慢,你可以等;软件跑不通,你连等的资格都没有。退一万步说,就算你路子野,搞到了卡,搞定了液冷,扛住了电费,养起了团队,把模型跑起来了——然后呢?你拿这套东西和官方API比一比就会发现,99%的公司自建永远不回本。我们拿DeepSeek V4-Pro的最低配方案来算一笔账。DeepSeek V4-Pro的API定价,输入每百万token 3元(缓存命中仅0.025元),输出每百万token 6元,还首创了“峰谷分时计费”,谷时算力费直降60%。不考虑峰谷的差价,假设你团队每天调用5000万token,其中输入3500万、输出1500万,这已经是一个相当高频的使用量了。输入费用为35×3=105元/天;输出费用为15×6=90元/天。每天合计不到200块钱,一年约7万。前面说了,16张H200光显卡就是376万,加上液冷改造30万、电力增容和场地改造30万,硬件首年投入约436万。再算运维,一个小团队一年人力百万,电费按16张 H200满载约11.2千瓦、24小时运转,整台服务器还要算 CPU、内存、硬盘、风扇,加上数据中心PUE,实际取电功耗大概在15-20千瓦左右。按工业用电1元/度算,一年电费应该在13万到18万之间。也就是说,不算硬件折旧,光是“养”这套系统,每年就要烧掉120多万。硬件按5年折旧,合计自建每年成本超过200万。大模型推理成本的核心逻辑是模型规模越大,推理越贵,然而API厂商靠规模效应摊薄成本的能力,远超任何单一企业。DeepSeek、Kimi、阿里这些厂商,一张GPU上跑着几百个用户的请求,批处理、KV缓存复用、投机解码、动态路由,每一项技术都在榨干每一滴算力。Kimi K3靠着缓存命中率超过90%,命中后输入成本仅为标准价的四分之一。你自己部署,一张卡就伺候你一个用户,GPU利用率可能连10%都到不了。老老实实用API,不丢人。你下载的模型和官方的模型是两回事就算你路子野,搞到了所有需要的设备,而且你花了好几个通宵终于成功地在你自己的设备上部署了想要的大模型。那么恭喜你,你跑出来的那个东西,和官方API里的那个东西,压根不是同一个物种。为什么?因为你能下载到的,只是权重文件。权重文件是模型的“记忆&rdq
分享
阅读原文