告别卷参数,百曜用世界模型重塑虚拟细胞
大模型动态
AI虚拟细胞
CellOS
JEPA架构
世界模型
百曜科技
过去几年,AI虚拟细胞赛道一直在死磕大语言模型,试图靠堆数据突破缩放规律,结果在预测细胞动态变化时频频撞墙。最近百曜科技发布了AURA CellOS,直接抛弃传统路线,把在自动驾驶里大放异彩的JEPA架构搬进细胞内部。这篇文章带你拆解这套12B参数模型的底层逻辑,看看它怎么从死记硬背基因表达,变成真正能推演细胞演化的世界模型,以及这对打破新药研发双十定律意味着什么。
百曜科技最近扔了个**,发布了号称全球首个基于大语言模型和联合嵌入预测架构的AI虚拟细胞世界模型CellOS。参数规模干到了12B,喂了3.9亿多个人类单细胞转录组数据。但比起秀肌肉,更值得琢磨的是他们背后的判断:在单细胞动态预测这件事上,靠疯狂堆参数的Scaling Law已经彻底失效了。
这不是危言耸听。今年6月《Nature Methods》发了篇很扎心的论文,团队拿2200多万个细胞预训练了400个模型,跑了6400次评估。结果发现,模型性能在吃掉大约1%的数据,也就是22万个细胞后就基本拉满,直接撞上了天花板。再多喂海量同质样本,效果根本不会涨。
瓶颈显然不在数据不够,而是传统大语言模型架构跟细胞数据特性根本八字不合。以前的AI虚拟细胞模型,本质上是在让机器死记硬背静态的基因表达模式。你给它看细胞现在的样子,它尽量原样复述出来。这就像让学生背课文,字都认识了,但根本不懂细胞在敲除基因或者给药后到底会怎么演化。那些真正驱动细胞状态变化的关键信号,全被淹没在庞大的背景噪声里。
既然卷参数走不通,百曜干脆换道,把LeCun四前提出的联合嵌入预测架构搬进了细胞内部。这步棋走得挺狠。这套架构的核心是世界模型理念,不追求在基因级完美复现输入,而是在隐空间里去预测和对齐事物的动态变化规律。以前模型只盯着细胞现在是什么样,现在CellOS要推演细胞未来会变成什么样。
把自动驾驶领域验证过的世界模型跨界用到生命科学,听起来像降维打击,实则是被逼出来的破局之法。当行业还在为多凑几万个细胞数据沾沾自喜时,百曜已经意识到,算力的尽头不是参数,而是对生物世界演化规律的真正理解。
要看懂CellOS怎么把死记硬背变成推演演化,得扒开它的底层架构。百曜这次没在老路上修修补补,而是直接重构了数据输入和预测方式。
以前的单细胞模型只盯着单个细胞的基因表达丰度,这种单一视角很容易把关键的调控信号当成背景噪声过滤掉。CellOS搞了个双视角互补机制,除了看单个基因活跃程度,还加入了群体感知视角,去评估这个基因在整个细胞群体里的特殊性。以前模型是管中窥豹,现在直接上了全景透视,把那些隐藏的重要生物学信号硬生生从噪声里捞了出来。
拿到高质量特征后,重头戏是JEPA架构的介入。传统大语言模型训练是让你把输入数据原样复述出来,本质上是隐空间的自回归解码。CellOS不玩这套了,它把双视角特征扔进隐空间,做跨视角预测和对齐。以前模型是在默写基因序列,现在是在推演细胞状态的演化轨迹。它不再纠结于单个基因表达数值的绝对精准,而是去捕捉基因调控关系和动态演化规律。
这套逻辑跑通后,数据喂养才真正有了意义。基于3.905亿个人类单细胞转录组训练的12B参数模型,在预测精度和扰动建模上跟主流模型拉开了倍数差距。当行业还在纠结怎么把参数从10B卷到100B时,CellOS证明了一件事:架构的代差比参数的堆叠更致命。与其在错误的范式里死磕算力,不如换个脑子,让模型真正去理解生物世界的物理法则。
技术逻辑理顺了,接下来就得算算经济账。生命科学领域有个著名的双十定律,一款新药从研发到上市,平均得砸进去10亿美元,熬过10年时间,临床成功率却不到10%。这么高昂的试错成本,全拜过去那种盲人摸象式的实验方法所赐。以前药企找靶点、测毒性,得在培养皿和实验动物身上一次次死磕,现在有了CellOS这种能推演细胞动态演化的世界模型,相当于直接在电脑里建了个高精度的虚拟试药场。
以前的基础模型只能告诉你细胞现在长什么样,现在的CellOS能准确预测你给药或者敲除基因后,细胞未来会怎么变。这意味着药企可以在早期阶段,直接在硅基世界里模拟药物扰动,把那些注定失败的分子提前踢出局。把大量昂贵的真实实验转化为低成本的计算模拟,这省下的可不仅是几百万美金的试剂费,更是实打实的研发周期。
对很多在生死线上挣扎的创新药企来说,能把临床前失败率降下来,把研发时间往前赶个一两年,就是救命的钱。别觉得搞世界模型进细胞只是为了在顶会上刷个跑分第一,技术的终极考验永远是商业化落地。当AI真正开始理解细胞的演化法则,新药研发的旧秩序就该被改写了,谁能先用这套虚拟沙盘跑出真实的临床收益,谁就能拿到下一个十年的入场券。