OpenAI在Hot Chips大会上甩出了自研推理芯片Jalapeño的首份成绩单。在SemiAnalysis的InferenceX测试中,这款芯片没去卷绝对算力,而是把每瓦性能拉到了新高度。跑分显示,在GPT-OSS 120B等模型上,Jalapeño每瓦完成的AI工作量是英伟达GB200和GB300超级芯片的1.5到1.9倍,端到端延迟直接降到对方的28%至59%。其实不只是云端在卷能效,端侧玩家也在换赛道。苹果刚发的M6和M5 Ultra芯片疯狂堆统一内存带宽,高通下一代骁龙旗舰也掏出了FlexCache共享缓存架构。大家似乎都默契地意识到,单纯堆砌计算核心已经碰壁了。 现在的AI算力竞争,早就跨越了数核心数的初级阶段。大模型落地最头疼的就是数据搬运瓶颈。Jalapeño能跑出这种成绩,靠的是OpenAI和博通从底层开始的全栈协同。他们把模型、芯片和内存绑在一起设计,重点优化预填充和通信这两个最拖后腿的环节。生成响应时的KV缓存直接留在本地,系统按需调配资源。这种思路跟高通用FlexCache把缓存变成共享池,或者苹果用超大统一内存让数据少跑路,本质上是一回事。大家都在想办法让数据尽量待在离计算单元最近的地方,减少跨总线搬运带来的延迟和功耗。 以前厂商发芯片喜欢拿峰值算力说事,现在看Jalapeño的打法,每瓦性能和系统级协同才是真金白银。对于大模型开发者来说,盯着纸面参数选卡的时代过去了。接下来评估算力方案,得把内存带宽、缓存架构和软硬件协同效率放在同一张表里算总账。毕竟,能把每一瓦电都榨出有效Token的架构,才是真正能帮公司省下真金白银的利器。 OpenAI没去死磕绝对算力,而是把矛头对准了数据搬运。Jalapeño在设计之初就尽量减少数据在总线上的无效折返跑。生成响应时的KV缓存被明确保留在本地,系统再根据推理的不同阶段,精准调配计算和内存资源。这种全栈协同直接掐住了预填充和通信这两个最拖后腿的环节。算力核心再猛,数据搬运跟不上也是干瞪眼。 这种打破内存墙的思路,现在成了全行业的肌肉记忆。高通在下一代骁龙旗舰上掏出的FlexCache架构,就是端侧的典型代表。他们把L2缓存打通成一个所有核心共享的池子,动态调整资源分配。智能体AI在处理一连串任务时,不同步骤跨核心轮流执行,共享缓存让任务切换时的数据直接留在原地,免去了重复加载的折磨。苹果在桌面端则走了一条更暴力的物理路线,M5 Ultra直接堆出1.2TB/s的统一内存带宽,M6也拉到了170GB/s,用超大统一内存强行抹平数据搬运的功耗损耗。 以前厂商发芯片总喜欢拿峰值算力忽悠人,现在大家终于认清现实,全行业都在合力给内存墙擦屁股。无论是云端的KV缓存本地化,移动端的FlexCache共享池,还是苹果的统一内存大水池,底层逻辑出奇一致:让数据死磕在离计算单元最近的地方。 评估算力方案如果还只盯着纸面核心数自嗨,迟早要吃大亏。把内存带宽、缓存架构和软硬件协同效率拉通算总账,找出那个能把每一瓦电都榨出有效Token的系统,才是大模型落地最该算的经济账。 理清了打破内存墙的底层共识,把视角拉高你会发现,云端和端侧在应对数据搬运时,走向了截然不同的两条产品路线。 云端玩家直接扎进全栈定制的深水区。OpenAI搞Jalapeño,根本没打算用现成的通用芯片拼凑,而是和博通从底层把模型、芯片和内存绑在一起设计。这种软硬一体的思路,为的是在庞大的算力集群里抠出极致的每瓦性能。正如理查德·何在媒体电话会上所说,Jalapeño“可以用相同的电力处理更多AI工作负载,同时更快给出响应”。云端数据搬运的功耗和延迟极其致命,只有把预填充和通信环节在系统级重新编排,让KV缓存死死留在本地,才能把每一瓦电都榨出有效Token。 端侧玩家受限于物理体积和严苛的功耗墙,只能走统一内存与共享缓存的架构缝合路线。苹果在桌面端直接选择了物理暴力,M5 Ultra硬生生堆出512GB海量统一内存和1.2TB/s的带宽,M6也拉到了170GB/s。这种超大统一内存池让计算单元直接在一个大水池里共享数据,强行抹平跨总线搬运的损耗。高通在移动端则玩起了微架构微调,用FlexCache把L2缓存打通成所有核心共享的池子。智能体AI跨核心切换任务时,数据不用重复加载,在内存受限的情况下硬是保住了性能底线。 这两条路线没有高下之分,只有场景决定的妥协与极致。云端拼的是全栈协同带来的系统级重构门槛,端侧卷的则是统一内存池和共享缓存的物理极限。企业级采购和开发者选云端方案,得看软硬件协同效率这本总账;挑端侧设备,盯紧统一内存容量和缓存带宽才是让本地大模型跑得更顺畅的硬指标。 还在盯着厂商PPT上的TOPS和核心数挑算力卡?趁早醒醒。以前大家买芯片像看跑车马力表,现在大模型落地拼的是物流调度能力。算力核心再猛,数据搬运跟不上也是白搭。开发者在选型时,要把内存带宽、缓存架构和软硬件协同效率拉通算总账。 云端部署大模型,别被单卡峰值算力忽悠。OpenAI的Jalapeño能把端到端延迟压到英伟达GB300的28%至59%,靠的不是死磕晶体管数量,而是把KV缓存死死留在本地,减少跨总线折返跑。这意味着,评估云端方案时,集群的互联带宽和内存层级设计权重,应当高于单纯的计算核心数。你得去抠预填充和通信阶段的延迟,找那种能把每一瓦电都榨出有效Token的系统级协同方案。 端侧跑大模型,物理内存池和缓存架构才是真命门。苹果M5 Ultra敢在桌面端硬扛数千亿参数模型,底气是512GB统一内存和1.2TB/s的带宽,M6也拉到了170GB/s。高通在移动端则用FlexCache把L2缓存打通成共享池,让智能体AI跨核心切换任务时数据不用重复加载。挑端侧芯片,别光看NPU算力,统一内存容量上限和缓存动态分配能力,直接决定了本地大模型会不会因为OOM(内存溢出)而崩溃。 算力竞争早就过了大力出奇迹的阶段。把数据流转效率放在选型首位,找出那个能打破内存墙的系统,才是大模型落地最该算的经济账。