最近具身智能圈子里砸下了一笔亿元融资,拿钱的戴盟机器人没去挤视觉大模型的独木桥,反而转身钻进了一条少有人走的触觉窄路。连阿里通义实验室的多模态大牛原玮浩都加盟了,带队死磕物理世界模型。这操作看似反常,其实点破了当前机器人落地的一大痛点:光靠摄像头,根本搞不定真实世界的物理交互。 你想啊,让机器人隔着屏幕看,它很难分清一颗葡萄和一颗玻璃珠的差别。视觉就像看美食照片,能认出是啥,但真上手捏,葡萄得用指腹轻托,玻璃珠能用指尖使劲,这分寸感靠看是看不出来的。戴盟押注的触觉模态,就是给机器人装上能感知压力、软硬和滑动的电子皮肤;加上他们主攻的物理世界模型,也就是不猜下一帧画面,专算下一秒手和物体接触状态的AI大脑,就是为了补上这个眼高手低的短板。 他们把这套逻辑拆成了两步走。先是认知层,让眼睛看到的画面直接翻译成手上的预判,看到材质就知道该用多大力。接着是执行层,搞出一套百赫兹高频触觉伺服,类似人类不经过大脑思考、瞬间缩手的脊髓反射。物体刚要滑脱,毫秒级的补偿动作就已经发出去了,根本不用等上层系统慢慢推理。说白了就是,机器人想真正走进厨房端盘子、下车间拧螺丝,不能只当个看图说话的学霸,必须靠触觉和物理模型练出真实的物理手感与力觉预判。这笔热钱砸向冷门路线,其实是在给具身智能补上走进现实生活的最后一块拼板。 既然公司铁了心不卷视觉,那过去纯靠摄像头的路线到底卡在了哪儿?问题就出在眼睛会骗人,而物理世界不讲情面。 你不妨在桌上放一颗葡萄和一颗大小一模一样的玻璃珠。单看摄像头拍下的画面,它俩在屏幕上几乎长得一样,但真要伸手去拿,策略天差地别。抓葡萄得用指腹轻轻包裹,力道重一分就爆汁;拿玻璃珠则可以用指尖稳稳捏住,稍微使点劲也没事。这就是典型的视觉陷阱。摄像头只能捕捉平面的像素和光影,这在学术上叫低维映射(通俗点说,就是屏幕里的画面只有轮廓和颜色,根本量不出物体内部的软硬、表面有多滑,以及抓握时手指该用多大的劲儿)。 过去很多机器人就是栽在这个坑里。它们拼命学怎么认出物体,却学不会怎么跟物体打交道。就像你隔着保鲜膜看水果,知道形状,但不知道熟没熟、一捏会不会破。真实世界里的关键信息,往往只有指尖真正贴上去的那一刻才会冒出来。物体表面是涩是滑,受力后会不会突然变形,这些物理属性单靠看是绝对猜不准的。 戴盟团队死磕触觉,就是为了捅破这层窗户纸。他们让视觉信号和触觉信号在同一个系统里互相翻译,机器人看到葡萄的瞬间,内部就已经算好了轻托的力道预案。说白了就是,光靠摄像头只能当个看图说话的学霸,只有加上触觉模态和能推演接触状态的物理模型,机器人才能把看到的画面直接转化成手上的分寸感,真正长出干活需要的物理手感与力觉预判。 看清了视觉的短板,机器人想要真正理解物理世界,就得换一套完全不同的预测逻辑。戴盟死磕的物理世界模型(也就是不猜下一帧画面,专算下一秒接触状态的AI大脑),跟咱们平时刷到的视频生成大模型完全是两码事。普通的视觉模型干的是脑补像素的活儿,而它只盯着机器人指尖跟物体接触的那一瞬间,去推算下一秒的压力分布、表面摩擦力,甚至提前算好这次抓握会不会滑脱、万一滑了该怎么补救。 你可以把它想象成老司机单手倒车入库。纯视觉方案是盯着后视镜一帧帧看车位线,而这套物理模型是坐在驾驶座上,脚底感受着方向盘的回正力,瞬间判断出车轮和马路牙子的距离。为了让判断绝对不慢半拍,团队把系统拆成了两路同时跑。一路是百赫兹级的高频触觉伺服(每秒刷新上百次触觉信号,通俗讲就是机器人的脊髓反射),它根本不经过大脑慢慢推理,手指刚感觉到物体要往下掉,毫秒级的微调指令就已经发出去了,这时候连新的摄像头画面都还没传上来。另一路是物理推演中枢,它会持续模拟接下来的接触轨迹,在失误真正发生前就把修正方案备好。 这两套机制一个管当下的瞬间反应,一个管未来的力觉预判,在同一个任务里无缝配合。说白了就是,机器人要想在现实里稳稳当当捏鸡蛋、拧螺丝,就不能只靠眼睛猜画面,得靠这套专算接触状态的模型,真正把物理手感和分寸感算进骨子里。 有了能预测物理交互的模型,实际执行时还得解决想到和做到之间的时间差问题。你肯定有过这种经历:手刚碰到烫杯子,还没等大脑反应过来喊疼,手指已经本能地缩回去了。这就是人体的脊髓反射,根本不走大脑那套慢吞吞的分析流程。戴盟给机器人安排的执行层,第一路就是百赫兹级高频触觉伺服(通俗讲就是每秒刷新上百次触觉信号,让机器人拥有不经过上层推理的瞬间反应力)。当指尖刚感觉到物体有一丁点打滑的趋势,毫秒级的微调指令就已经发出去了。要知道,这时候普通摄像头连下一帧画面都还没传回处理器呢,纯靠视觉的机器人还在排队等图像生成,东西早就掉地上了。 光靠条件反射还不够,干活得有预判。系统的另一路是物理推演中枢,它就像个经验丰富的老师傅,一边捏着物件,一边在后台持续模拟接下来的接触轨迹。它会提前算好:如果表面突然变滑,手指该补多少力;如果重心偏移,手腕该怎么提前调整。这两套机制在同一个任务里并行不悖,一路管当下的保命反应,一路管未来的接触状态前瞻。 说白了就是,机器人想彻底告别慢半拍,不能只等眼睛看清了再动脑子,得把触觉信号当成身体的本能。靠这套毫秒级反射加前瞻大脑的组合拳,机器人才能真正长出真实的物理手感与力觉预判,稳稳当当去车间拧螺丝、进厨房端盘子,而不是在真实世界里手忙脚乱地捡碎片。 这套精妙的双层机制听起来很完美,但想让它真正跑起来,最头疼的其实是喂数据。很多人以为搞AI就是拿海量数据猛灌,但在触觉这条路上,套路全变了。让机器人对着同一个马克杯反复抓一万次,根本练不出真本事。真正值钱的是让它在砂纸、湿肥皂、冻肉块等上千种不同材质的物体上各碰十次。这就像新手司机考驾照,你在空旷的驾校练一万圈,不如去湿滑的泥地、狭窄的胡同和坑洼的土路各开几趟来得管用。模型要学的是软物会变形、滑面要加侧向力这种底层物理规律,而不是死记硬背某个杯子的肌肉记忆。 光有花样还不够,这些数据还得严丝合缝地对齐。机器人手指碰到物体的那一刹那,皮肤上的压力分布、摄像头拍到的画面、关节转动的角度和扭矩,必须在毫秒级别上完全同步。多模态对齐,通俗点说就是把不同传感器记录的数据按精确时间点拼成一条完整的证据链。一旦乱套,因果关系就全反了。比如明明是手腕先发力导致苹果凹陷,如果数据慢了半拍,模型就会傻乎乎地以为是苹果自己先变软,才逼得手腕去动。练出来的机器人自然就是个倒果为因的糊涂蛋。 为了解决这个难题,戴盟干脆把采集设备打包成标准化模块,直接铺到工厂和物流园的合作方手里,让真实干活场景变成数据源。今年四月,他们联合谷歌DeepMind等机构发布了全球规模最大的含触觉全模态数据集。不过团队也坦言,触觉的Scaling Law,也就是数据量堆到一定规模后模型能力会突然开窍的规律,目前还没真正显现。原因很简单,行业连张公认的触觉考卷都没有。为此他们又联手推出了首套含触觉的物理交互评测基准,先立好尺子,才知道模型到底长没长进。 说白了就是,触觉数据不是靠机器人在实验室里闭门造车刷出来的,而是要把它扔进千奇百怪的物理碰撞里去挨打。只有吃够了不同材质和力道的亏,模型才能把那些看不见的物理手感与力觉预判,真正刻进骨子里。 数据采集的难题有了采集解法,接下来就得回答一个更关键的问题:怎么证明触觉模型真的变强了? 搞视觉AI的时候,行业早就有现成的榜单当考卷,跑分高了自然就证明模型厉害。可换到触觉领域,目前连张公认的卷子都没有。你让一家公司说自己的机器人手感好,另一家说自己的力控准,到底听谁的?没有统一标准,模型能力再强也像是在黑箱里摸象,谁也说不清是真实力提升,还是单纯在某个特定物体上背熟了题。 这就像考驾照,如果每个考场自己定规则,有的只看倒车入库停没停正,有的却要看侧方压没压线,那最后拿证的人上了路照样手忙脚乱。触觉模型也一样,它需要的不是单点测试,而是一套能同时考验抓握力度、材质辨识和防滑预判的综合考场。 为了解决这个痛点,戴盟最近联合银河通用发布了RobOmni(通俗点说,就是行业里第一套专门给机器人触觉打分的标准化考卷)。这套评测基准有意思的地方在于,它既能在电脑仿真环境里跑,也能直接拿到真实机械臂上测。考的内容不是看画面多清晰,而是实打实地测物理交互:比如让机器人去捏不同软硬的海绵、抓表面打滑的零件,或者在指尖刚感觉到滑脱趋势时调整力度。模型能不能在毫秒级内给出正确的物理手感与力觉预判,考卷上直接出分。 戴盟团队直言,虽然大家都在盼着触觉领域的Scaling Law(也就是数据量堆到某个临界点后,模型能力突然开窍的规律)早点到来,但在那之前,必须先立好标尺。先有公认的尺子,谈模型变强才有意义。只有拿同一张卷子反复测,才能看清算法迭代到底带来了多少真实的物理交互提升。 说白了就是,机器人要想真正进厨房端盘子、下车间拧螺丝,不能光靠实验室里的自说自话。有了这把统一的触觉标尺,具身智能才算真正拿到了走进现实物理世界的通行证。 标尺立住之后,这条触觉路线最终会如何改变我们身边的机器人?咱们不妨把目光从安静的测试台,直接拉到满是油烟的后厨和叮当作响的装配车间。过去机械臂端个瓷碗,要么捏出裂纹,要么抓不稳滑脱,病根就在于它们只有眼睛没有手感。等这套带触觉的物理世界模型真正成熟,干活逻辑就全变了。 想象一下,机器人去切熟透的番茄,指尖刚蹭到果皮,压力分布信号瞬间传回,模型立刻算出皮薄肉软,下一刀的力度自动卸掉两成。去产线拧一颗带毛刺的螺丝,它不用死背固定扭矩,而是靠指尖感受螺纹咬合的阻力变化,手腕随时微调,直到严丝合缝。这就像老师傅带徒弟,不是靠背操作手册,而是靠一次次上手摸索,把分寸感刻进肌肉记忆里。 每一次成功的抓取和打滑后的自我修正,都会通过真实场景的数据飞轮(也就是把干活数据不断喂给模型让它越用越聪明的循环)反哺算法。当不同材质的碰撞经验攒到临界点,触觉的Scaling Law(也就是数据量堆到一定规模后模型能力突然开窍的规律)自然会显现。说白了就是,具身智能想真正下场干活,必须跳出纯视觉的局限,靠触觉模态和物理模型练出真实的物理手感与力觉预判。当AI终于长出能感知软硬滑涩的电子皮肤,那些需要巧劲的精细活儿,机器人就不再是笨手笨脚的替补,而是能稳稳当当走进真实生活的实干家。