功耗降50%,国产TPU须臾的能效账本
大模型动态
中昊芯英
TPU芯片
大模型算力
智算中心
推理成本
大模型狂奔的尽头是算力焦虑,而算力焦虑的尽头是电费单。上周,一位负责智算中心运维的朋友跟我倒苦水,说现在买卡难,养卡更难。就在6月30日,中昊芯英交出了一份新答卷:全自研TPU芯片「须臾」与智算底座「泰则 2.0」同步亮相。单芯片混合精度浮点算力飙到896 TFLOPS,但单卡额定功耗死死压在600W,比传统芯片降了50%。这不仅仅是跑分数字的狂欢,更是国产算力在“抠成本”上的一次肌肉展示。结合近期OpenAI将推理成本腰斩的行业动向,底层算力的竞争逻辑已经变了,能效比才是接下来的主战场。
OpenAI工程师最近透了个底,靠系统底层优化把AI推理成本砍了50%以上,而且没靠疯狂堆新显卡。这消息在圈里炸了锅,但也戳中了国内大模型运维朋友的痛处。机房里电表转得冒烟,算力没跑满,电费先爆表。
这时候看中昊芯英刚发的新一代TPU芯片须臾,味道就对了。单芯片混合精度浮点算力干到896 TFLOPS,是上一代的三倍。但更狠的是能耗,单卡额定功耗压在600W,直接比传统算力芯片砍掉一半。以前大家买卡只看PPT上的峰值参数,现在算账得看电表。
这正是国产大模型算力底座正在经历的拐点,从盲目拼峰值参数,转向死磕系统能效与落地成本。须臾不仅算力飙了,8-bit推理算力达到1792TOPS,专门对付海量词元高并发。配合他们那个泰则2.0智算平台,同等任务下整机能耗只有传统GPU服务器的80%。
跑分好看只能骗骗投资人,运维兄弟看着电费单可是要骂娘的。中昊芯英这次没去卷虚无缥缈的绝对算力第一,而是把能效比做到了极致。在算力即电力的今天,谁能把每一度电都榨出最多的Token,谁才算真正拿到了下半场的入场券。
跑分数据固然亮眼,但决定芯片能不能在真实业务中扛住高并发的,往往是那些看不见的底层设计。现在大模型死磕上下文长度,动辄几十万Token,这时候显存容量和内部互联速率就是命门。须臾在这块做了针对性强化,显存和互联速率大幅提升,硬吃超长上下文不拉胯。这对做长文本分析、复杂代码生成的业务来说,直接推倒了显存墙。
比性能更致命的其实是安全合规。须臾的芯片IP核、专属指令集、底层算子加速库再到整机系统软件,全链路自己搞定,没留一点海外核心技术的依赖。这可不是单纯为了秀技术肌肉。在政务、金融、电网这些对数据安全有洁癖的行业里,没有自主可控的底牌,算力再高连招投标的门槛都摸不到。全自研直接帮中昊芯英拿下了这些高净值场景的敲门砖。
这其实就是国产大模型算力底座正在经历的真实拐点,正从拼峰值参数转向拼系统能效与落地成本,中昊芯英的新芯片正是这一趋势的缩影。以前厂商喜欢拿峰值参数去讲故事,现在大家回过味来了,不仅要把能效比抠到极致,还得用全自研和长文本支持把应用场景彻底打通。
纯拼参数的PPT战已经打不响了。能拿着全自研的合规底牌,去啃政企和高并发场景这块硬骨头,把每一度电和每一次推理都算明白,才是真正活到最后的硬核玩家。
单卡跑分再猛,真到了大模型训练和推理的实战里,拼的终究是集群作战能力。这时候,系统级的能效优化才是真正的降本杀器。
OpenAI最近把推理成本砍了一半,靠的不是疯狂买卡,而是把现有服务器资源利用率榨干了。中昊芯英的思路异曲同工。他们搞出的泰则2.0智算平台,把两路CPU和8片须臾TPU打包成标准最小计算单元。这套组合拳打下来,同等任务下整机能耗直接降到传统GPU服务器的80%。
光硬件省电不够,软件调度也得跟上。泰则2.0在系统层面原生支持PyTorch、vLLM等主流框架,训练场景直接适配DeepSpeed和Megatron-LM分布式套件。Qwen、DeepSeek等几十款大模型都做了深度适配。开发者不用在底层代码上死磕,模型迁移周期大幅缩短。这种软硬一体的系统级优化,才是把算力损耗降到最低的真功夫。
以前大家迷信单卡算力,觉得堆料就能出奇迹。现在算力进入深水区,从单卡到集群的系统级调度才是决定投资回报率的核心。中昊芯英用泰则2.0证明了一点,不盲目卷单卡峰值,把集群能效和软件生态抠到极致,让每一张卡都在集群里发挥最大价值,这才是国产算力底座真正该走的路。
硬件搭好了台,生态也兼容了,接下来就是真刀真枪的场景落地。算力不能只在机房里跑分自嗨,最终得落到具体业务里算经济账。
以前买卡看单价,现在算账看TCO(总拥有成本)。须臾单卡功耗压到600W,泰则2.0整机能耗降到传统GPU的80%,省下来的电费、散热和运维开销,实打实都是利润。OpenAI靠底层优化把推理成本砍半,国内玩家要是还不懂算这笔账,迟早被市场教做人。
场景落地不能只盯着互联网大厂,中昊芯英瞄准的是政务、金融、电网这些对数据安全有洁癖的硬核领域。全自研底座让他们免去了合规审查的扯皮。优必选周剑说得透彻,家庭陪伴机器人最能带来生态,但前提是得先在工业和商用市场把营收支柱打牢。算力底座同理,先在政企高并发场景里把坑占住,把模型迁移和推理成本降下来,开发者生态自然就跑通了。
大模型下半场,拼的不是谁的PPT参数更炫,而是谁的落地成本更低。把每一度电、每一次推理都折算成真金白银的ROI,才是国产算力真正站稳脚跟的底气。