国产GPU配类脑芯片,推理成本砍掉四成,这条“异构“路值得细看
上周在廊坊的2026中国算力大会上,移动云联合南湖研究院、灵汐科技、天数智芯还有清华北大,发了一套东西,名字挺长,叫"国产GPU+类脑芯片大模型异构混合推理系统"。说实话,我第一眼看到这个标题是有点犯嘀咕的——又是异构、又是类脑,听着像学术黑话堆出来的概念。但看完它公布的实测数据,我改主意了:在DeepSeek V4上,性能比同类国产GPU集群翻了一倍,运营成本砍了40%以上。
这个数字放到现在这个节点,很扎眼。因为国产芯片这两年最难啃的骨头就是推理,不是训练。训练是短跑,咬牙堆一批机器、跑个把月就完事;推理是马拉松,每来一个用户、每答一句话都在烧钱。当你的模型终于跑起来了,真正的噩梦才刚开始——账单。
所以这次他们不拼芯片算力本身,而是换了条思路:让不同类型的芯片各干各的擅长的活。这个"分而治之"背后的逻辑,我觉得比那个"类脑"噱头更有嚼头。
先说清楚单一GPU到底卡在哪。大模型推理一次请求,可以粗略分成两段:前面把整段输入吃进去、算出每个token的key和value,这叫Prefill(预填充),计算密集、对吞吐要求高;后面逐字往外吐,每一步都依赖之前所有位置的上下文,这叫Decode(解码),带宽密集、极度吃显存。现在主流方案是让一块GPU从头扛到尾,于是问题就来了——Decode阶段大量时间其实是在等数据从显存里搬出来,算力是闲着等数据的。圈里管这叫"内存墙",算力上去了,带宽没跟上,GPU再快也是干等着。
移动云这套系统的做法,说白了就是不再让一块芯片干所有事。他们把Transformer拆开:Prefill和Attention这些计算密集的部分留给国产GPU去跑,发挥通用计算的强项;而FFN(就是MoE里那些专家模块)这种对带宽和延迟特别敏感的部分,交给类脑芯片。类脑芯片是什么?它主打的就是存算一体加片上大容量SRAM,数据存在哪就在哪算,不来回倒腾,正好治"内存墙"的病。整套系统的思路可以概括为"各司其职",用他们技术总监的话说,就是给GPU装了个涡轮增压。
这一下把问题从"我该买多少A100"变成了"我怎么让手里已有的国产芯片干活效率更高"。我觉得这才是最值钱的地方。因为对绝大多数公司和团队来说,算力芯片最缺的从来不是某一款特别牛的卡,而是把现有资源吃干榨净的能力。用类脑芯片去补GPU的短板,等于在国产芯片供给本来就不宽裕的前提下,凭空多挤出四成运力,这个账怎么算都划算。
很多人问,这条异构路线是不是只是国产芯片的无奈之选,老黄那边用不着。我倒不这么看。英伟达自己其实也在走类似的路,Vera Rubin那套,以及收购Groq的LPU方案,本质上都是想让推理专用硬件接走GPU不擅长的那部分活。区别在于,国外是用更猛的专用芯片去抢高端市场,国内是拿类脑芯片去补国产芯片的性价比。方向一致,起点不同,但说到底都指向同一件事:单一通用GPU包打天下的时代,可能真的要过去了。
对做应用和搞部署的工程师来说,这意味着什么?我个人的感受是,推理成本的账要重新算一遍。以前你估一个Agent或RAG服务的成本,基本就是按GPU租用价格乘以tokens往上堆,天花板很明显。一旦异构推理这套东西真跑进生产环境,单位token的成本曲线会被压得比想象中平,那些"算不过来账"的应用——比如低毛利的对话、免费层的多轮问答——就重新有了活路。李开复早几年说过,推理成本降到一定程度,很多应用会从付费变成免费,现在看这个临界点可能比预想来得快。
当然,这套系统现在还是大会上的首发,距离大规模商业落地还有距离。类脑芯片的生态成熟度、跟主流框架的适配、以及真正的长周期稳定性,都需要时间验证。我比较好奇的是,这套"GPU+专用推理芯片"的分工,能不能从类脑芯片泛化到其他国产推理加速卡上,沉淀成一套通用的异构标准;我也在琢磨,等推理成本真被打下来的那天,那一堆因为算不起账而被砍掉的Agent应用,会不会集体复活。
你那边怎么看国产算力这条异构路线?是觉得它只是过渡方案,还是认为它会在推理时代彻底改写算力格局?欢迎评论区聊聊。
更多推荐


所有评论(0)