凌晨三点,看着屏幕上弹出的API请求频率超限提示,不少开发者估计血压都上来了。这真不是平台故意卡脖子,而是大模型的算力焦虑已经实打实地演变成了基础设施的军备竞赛。 就拿智谱来说,API注册用户眼看就要冲破700万大关,单月猛增200万。流量这么猛,光靠嘴炮不行,得砸真金白银买卡。他们直接启用了超5万块国产算力芯片来扛日益增长的推理压力。以前市场总觉得他们在底层基建上差点意思,现在靠着先发优势疯狂补课。有投资人透底,现在模型能力越来越趋同,谁能“用同样的卡跑出更多token”,谁的账本才好看。 这种算力饥渴症早就不是一家的事了。你看英特尔,为了抓住AI计算这波前所未有的需求,反手就搞了个150亿美元的股票发行来充实资本支出。再看存储端,AI数据中心疯狂扩建,硬生生把江波龙这种硬件卖水人的半年净利润拉高了7万多倍。整个行业的底层硬件都在跟着大模型的胃口水涨船高。 参数规模的数字游戏早就玩到头了,现在拼的就是谁的Infra效率更高,谁的底层基建更抗造。算力涨价潮下,光靠堆显卡已经行不通,优化推理链路、榨干每一滴算力才是活下去的真本事。 凌晨三点API被限流的痛,一线开发者都懂。为了不让用户骂娘,智谱这次是真的下血本了。他们的开放平台注册用户眼看就要摸到700万的门槛,单月猛增200万。流量这么猛,光靠PPT可扛不住推理压力。智谱直接拍桌子,启用了超过5万块国产算力芯片来填这个无底洞,甚至传闻搞出了1GW规模的国产AI算力基建。 以前圈子里总有人嘀咕,说智谱在底层基建上缺乏经验。现在人家靠着GLM-5的先发优势,正拼命补齐这块短板。有投资人跟我透底,现在大模型能力越来越趋同,谁能“用同样的卡跑出更多token”,谁的账本才好看。Infra层优化已经成了未来一两年AI投资的核心主题。 千万别小看这1%的效率提升,放在几万块卡的大规模集群里,省下来的真金白银就是天文数字,这也难怪现在Infra工程师的薪资涨得飞起。再看看隔壁做存储的江波龙,靠着AI数据中心扩建,半年净利润暴增七万多倍,硬件卖水人都赚麻了。在底层硬件疯狂涨价的背景下,智谱狂囤国产卡不仅是为了保供,更是为了把算账的主动权捏在自己手里。 大模型竞争早就过了拼参数规模的草莽阶段。现在拼的是谁的Infra效率更高,谁能把每一滴算力都榨干。不会精打细算搞基建的模型公司,迟早会被高昂的算力账单拖死。 智谱的算力需求只是冰山一角,整个AI硬件和存储产业链都在迎来一场狂欢。 看看江波龙刚交出的半年度财报,归母净利润直接飙到105亿,同比暴增七万多倍,存储产品毛利率更是逼近60%。这数据看着吓人,但背后逻辑很清晰。AI数据中心疯狂扩建,企业级存储需求彻底爆发。以前大家买存储只看容量够不够大,现在得看能不能扛住大模型的高并发吞吐。在这个风口上,卖铲子的硬件厂商确实赚麻了。 算力巨头们也没闲着。英特尔反手就宣布拟发行150亿美元(约合人民币1012亿元)的普通股。官方说辞是下游客户需求强劲且具备可持续性,意思就是AI算力的胃口太大,得赶紧搞钱扩产。从先进封装到专用硅片,英特尔正拼命想抓住这波物理AI的红利。 大模型竞争早就过了拼参数的草莽阶段,全面转向底层基础设施的军备竞赛。不管是存储芯片还是算力代工,都在疯狂吃大模型的红利。硬件卖水人赚得盆满钵满,但模型公司不能只当盲目囤卡的冤大头。买卡只是入场券,怎么把Infra效率榨到极致,把每一滴算力都用在刀刃上,才是下一轮淘汰赛真正的门票。 硬件基建在狂飙,但在大洋彼岸,Meta正试图通过端侧模型和政策松绑来另辟蹊径。 扎克伯格最近抛出一篇14页的长文,直接喊话美国政策给开源AI松绑。老扎这算盘打得挺响,既然自家建数据中心面临重重阻力,训练数据又受限,不如换个赛道卷端侧和开源生态。他直言把AI权力高度集中并不安全,这话听着冠冕堂皇,实则是在为Meta的开源路线造势。 技术动作上,Meta刚发布的Muse Glimmer模型就是冲着端侧来的。这模型不拼庞大参数,主打一个接地气,单张显卡的Mac或PC就能跑智能体任务。以前大家总觉得大模型必须得在云端机房里疯狂烧钱,现在Meta直接把桌子掀了,让AI直接塞进开发者的个人电脑里。不仅如此,他们连Muse Spark 1.2的权重都准备公开,这可是超级智能团队砸重金搞出来的家底。 端侧小模型搅动开源局,本质上是拿生态去硬刚算力壁垒。当云端算力被大厂和资本死死捏在手里时,把模型做小、塞进端侧、开放权重,让全球开发者一起来用,才是真正能破局的杀手锏。老扎还专门设立了10亿美元基金来安抚建数据中心受影响的社区,可见这基建路线在美国走得多憋屈。 大模型的下半场,云端拼Infra抠成本,端侧拼生态抢入口。与其在云端跟巨头卷参数规模,不如把AI真正塞进每一台个人设备里,这或许才是开源社区最大的机会。 江波龙2026年上半年归母净利润同比增长71528.66%,存储硬件利润暴增 英特尔拟进行150亿美元股票发行融资,用于一般企业用途 不管是云端死磕Infra,还是端侧猛推开源,大模型这盘棋的底层逻辑已经彻底变了。以前大家发模型,恨不得把参数量吹上天,跑分榜单刷得飞起。现在各家模型能力严重趋同,用户根本感知不到底层到底是几百亿还是上千亿参数。当模型本身拉不开差距,拼的就是谁更会算账,谁更懂生态。 算账的核心在Infra。智谱狂囤5万块国产算力卡,本质上是在为日益暴涨的推理需求买单。江波龙靠着AI数据中心扩建半年净赚百亿,英特尔更是直接砸150亿美元发股票扩产。硬件卖水人赚得盆满钵满,但模型厂商如果只懂盲目堆卡,利润全被高昂的算力账单吃干抹净。有圈内人算过一笔账,在万卡集群里,1%的Infra效率提升省下来的电费和时间成本,就是个天文数字。谁能用同样的卡跑出更多token,谁才能在价格战里活下来。 至于端侧开源,那是另一条破局路。云端算力被大厂死死捏在手里,中小团队根本玩不起。Meta把模型做小塞进单张显卡的PC里,还大方公开权重,这其实是把算力压力分摊给了全球开发者。与其在云端跟巨头卷参数规模,不如去端侧抢入口。 别再去迷信什么参数神话了。对于现在的模型公司来说,去抠那1%的推理延迟,或者去端侧找增量场景,比多买几张显卡实在得多。不会精打细算搞基建的玩家,迟早会被账单拖死。 看清了行业趋势,落到具体业务上,开发者和企业该如何应对这波算力涨价潮?以前大家写代码,习惯无脑调云端大模型API,现在智谱的Coding Plan大幅涨价,API调用成本肉眼可见地变贵。这时候还去死磕百亿参数的云端推理,纯属给硬件卖水人打工。 真正聪明的做法是向Infra要利润。智谱ZCode上线一个月就能破百万用户,靠的不是参数多大,而是底层调度。开发者得把精力从调参转移到优化推理链路上,死磕KV Cache优化、模型量化,把每一毫秒的延迟抠出来。你看江波龙都在搞5nm自研主控芯片来提升端侧大模型规模上限,硬件都在往端侧发力,软件端如果不跟着做轻量化适配,迟早被高昂的账单拖死。 另一条出路是拥抱端侧开源生态。既然云端算力被巨头捏在手里,不如把模型塞进用户的个人电脑里。Meta刚发布的Muse Glimmer能在单张显卡的Mac或PC上跑智能体,还准备公开Muse Spark 1.2的权重。开发者完全可以基于这些开源小模型,结合本地存储和算力,搞端侧原生应用。 算力涨价潮下,捂紧钱包的核心不是停止开发,而是转变思路。别再迷信云端大参数的暴力美学,把模型做小、把推理做快、把生态做宽,才是中小团队在这场基建军备竞赛里活下去的底牌。