英伟达调动5000亿美元建设基础设施,资本正按最乐观的预期疯狂砸钱加速算力金融化。但你把视线切到端侧,画风完全变了,这帮人正盯着几吉字节的内存抠抠搜搜。 蚂蚁刚开源的Ling-3.0-tiny就是个活标本。7.9B的总参数,硬是靠着混合线性架构和稀疏MoE,压到每次只激活1.3B。跑在M4 Pro芯片的Mac mini上,速度能飙到八九十Token每秒,8K上下文峰值内存死死卡在8.34 GiB。 这就是当下AI圈最撕裂的现实。云端巨头拿着千亿支票买卡,赌的是星辰大海;端侧玩家却在死磕轻量化架构,算的是今天的柴米油盐。云端比拼的是谁的资产负债表更能扛,端侧较量的则是在功耗墙和硅片面积里榨出最后一滴性能的硬功夫。 别被云端那些动辄万亿参数的宏大叙事忽悠了。当大模型真正变成用户每天点开的常驻工具时,那些能在本地断网运行、不烫手还能秒回的抠门算法,才是真正能活到最后的底牌。 蚂蚁这次掏出Ling-3.0-tiny,表面上看是跟着开源大潮凑热闹,但仔细拆解它的技术栈,你会发现这帮人把端侧生存法则玩明白了。 他们没去卷那些几十B的稠密架构,而是弄了个混合线性架构。把KDA和MLA按3比1的比例交替堆叠,再塞进128个路由专家。这套组合拳打下来,总参数7.9B,每次推理只唤醒1.3B。这根本不是为了在开源榜单上跟大厂拼刺刀,而是精准瞄着普通人桌上那台内存捉襟见肘的电脑去的。 现在苹果设备的统一内存贵得离谱,端侧跑大模型最大的拦路虎就是内存墙。蚂蚁这步棋精就精在,它把上下文处理和计算成本掐得死死的。8K上下文峰值内存控制在8.34GiB,这意味着你的Mac mini甚至不用杀后台,就能流畅跑多步骤推理。官方还贴心地给出了INT4和FP8版本,连英伟达的DGX Spark这种桌面级工作站都一并适配了。 当云端巨头拿5000亿搞算力金融化的时候,蚂蚁这种在硅片面积和功耗墙里抠性能的务实派,反而摸到了端侧AI的真脉门。大模型要真正落地,靠的不是在云端跑个漂亮的跑分,而是能在断网的轻薄本上,不烫手、不卡顿地帮你把活干完。能在抠门的硬件上跑出越级体验,才是端侧模型活到最后的底牌。 这种在硅片里抠算力的焦虑,早就从PC桌面蔓延到了四个轮子上。最近华为、理想、小鹏、小米几家巨头凑在一起拆论文,死磕世界模型与VLA。外界看着热闹,以为又是新一轮算法路线的口水战,但扒开表象看,这本质上还是端侧算力焦虑在物理世界的集中爆发。 云端大模型可以不计成本地堆卡,但车里不行。车规级芯片的功耗墙、散热极限和硬件成本卡得死死的。搞个庞大的视觉语言动作模型,真要在车端那颗算力捉襟见肘的芯片上跑实时推理,不拼命做轻量化就是自寻死路。以前搞智驾,车企喜欢简单粗暴地堆激光雷达和写死规则代码;现在风向变了,拼的是谁能把世界模型极度压缩,塞进那块巴掌大的智驾板子里。 架构之争的底牌,全是对底层硬件极限的疯狂试探。VLA也好,端到端也罢,概念再炫技,也绕不开车端真实的算力天花板。别拿云端那套大力出奇迹的逻辑来套汽车,智驾拼到最后,比的不是谁的参数量大,而是谁能在有限的功耗和内存里,把模型压榨出最稳的实时响应。能在发热严重的铁盒子里跑出丝滑体验,才是端侧AI真正能保命的硬通货。 蚂蚁百灵开源 Ling-3.0-tiny 模型,支持英伟达 DGX Spark、苹果 Mac mini 部署 软件架构再怎么极限微操,最终也得砸在物理硅片和存储颗粒上。端侧AI这场仗,打到最后其实是底层硬件供应链的贴身肉搏。 以前苹果靠着海量订单,在供应链里说一不二,死死拿捏着上下游的定价权。但现在搞端侧AI,情况变了。大模型本地跑,最吃的就是统一内存和高速存储。结果呢?苹果在终端市场引以为傲的议价权,硬是被国内某存储芯片厂的报价策略给卡了脖子。库克估计也没想到,自己玩转多年的买方霸权,会在端侧AI爆发的节骨眼上首次失灵。 这背后的逻辑很现实。云端巨头可以闭着眼睛砸下五千亿买英伟达的算力卡,玩的是资本游戏。但端侧设备拼的是极致性价比和供应链的自主博弈。你要在轻薄本或者车机里塞进大模型,内存带宽和存储速度就是死穴。以前厂商习惯用软件去适配硬件的短板,现在发现软件优化到极限,还得靠底层硬件来兜底。 车企们死磕智驾架构,蚂蚁在Mac mini上抠内存,本质上都是在试探现有硬件的物理极限。当软件层面的轻量化红利吃完,端侧AI的下一张明牌就是定制化的NPU和国产存储芯片的突围。别再迷信全球供应链的温情脉脉了,能在底层硅片上掌握定价权,才是端侧AI真正能挺直腰杆的底气。这局底层硬件的暗战,你猜谁能笑到最后? 看多了云端那些动辄万亿参数的宏大叙事,再看看端侧这帮人在功耗墙里抠抠搜搜,真有种看魔幻现实主义的错觉。英伟达那边正拿着五千亿美元玩算力金融化,赌的是未来十年的乐观预期。而蚂蚁的工程师却在为Mac mini上那8.34GiB的内存峰值绞尽脑汁,硬是把7.9B的模型塞进普通人的轻薄本里。 这种割裂感在物理世界更明显。以前车企搞智驾喜欢简单粗暴堆硬件,现在华为、理想们死磕世界模型和VLA架构,本质上是车端那颗算力捉襟见肘的芯片逼出来的。你总不能在发热的铁盒子里跑个千亿参数的大模型。更扎心的是,软件优化到了极限,还得看底层硬件的脸色。连苹果这种拿捏供应链多年的霸主,在端侧AI爆发时,也会被国产存储芯片厂的定价策略卡住脖子。 别被云端的大词忽悠了。大模型要真正变成生产力,靠的不是在数据中心跑个漂亮的跑分,而是能在断网的轻薄本上秒回,在断网的汽车里做出安全的避让。端侧拼的从来不是谁的算力上限高,而是谁的性价比极致、谁的底层供应链自主可控。 当资本在云端击鼓传花时,端侧的实用主义者正在泥泞里建堡垒。与其盯着那些遥不可及的通用人工智能大饼,不如多关注那些能在有限硅片面积里榨出性能的硬功夫。能让普通用户在不插电、不发烫的设备上顺滑用上的AI,才是真正能掏空他们钱包的杀手锏。