全球有7000万听障人士使用200多种手语,但他们日常发个消息却只能靠手指在屏幕上艰难地戳字。现在这个尴尬的局面终于被打破了。 谷歌DeepMind刚搞出了一个大动作,把多语言手语转文本模型直接塞进了Pixel 11系列手机里。Gboard和Live Transcribe现在支持手语输入了(初期先上美国手语)。这意味着听障朋友终于有了属于自己的语音输入法,对着镜头比划,手机就能直接出字。 以前那些所谓的手语翻译软件,大多是把手语动作拆成一个个单词去硬凑,语法稀碎。这次谷歌的SL2T模型算是玩明白了,他们拿超过50种手语的10万小时数据去喂模型,让AI直接去理解手语独特的空间语法和词汇,而不是死板地按顺序转换。测试数据很打脸,听障人士用美国手语输入,居然比用英语键盘打字还要快,体验也更自然。 更值得一提的是隐私保护。以前搞视觉识别,总得把视频传到云端去跑,现在这个模型直接在手机本地把手部动作转化成特征点坐标。原始视频根本不用上传服务器,这就呼应了AI视觉从云端走向端侧消费级硬件的大趋势,在保护隐私的前提下彻底打破了生理交互的壁垒。 技术不该只是极客的玩具,而是填平鸿沟的铲子。当AI能看懂听障人士的手部翻飞,我们才算真正摸到了无障碍交互的门槛。建议各大手机厂商赶紧抄作业,别总盯着跑分,多把算力用在这些真正能改变少数人生活的地方。 从听懂特殊语言的自然交互,我们顺理成章地来看看AI是如何看懂并接管专业操作的。以前买相机,小白最怕看什么?光圈、快门、感光度,还有那堆让人头秃的对焦区域。现在这套玩法正在被掀翻。 影石CEO刘靖康最近透了个底,他们正在搞两款可换镜头相机,其中一款造型绝对颠覆认知。他放话要引入新技术与人工智能,让不了解相机的普通用户也能轻松上手。这等于直接宣告,传统相机那种死磕构图、对焦、按快门的肌肉记忆训练,以后可以省了。之前曝光的Z-ONE谍照看着还是常规卡口的模样,但明年展会上要露脸的原型机,估计会把AI视觉玩出花。 这跟前面谷歌搞手语翻译的底层逻辑是一脉相承的。手语翻译靠强大的端侧计算机视觉去捕捉多部位同步运动,AI相机同样需要端侧多模态视觉去实时理解场景和主体。以前我们总觉得AI拍照就是套个滤镜、算个法,现在它是直接打破专业壁垒,接管创作门槛。你不需要懂什么是三分法构图,AI直接帮你裁切;你不需要懂峰值对焦,AI视觉直接锁定你视线停留的主体。 以前厂商卷传感器尺寸、卷像素数量,现在风向变了,开始卷谁能把专业参数藏得更好。把复杂的参数调教交给端侧AI,把简单的出片留给用户,这才是消费级硬件该有的样子。 别再去背那些晦涩的摄影参数了,未来相机的核心竞争力不再是你能拍出多复杂的曝光,而是它能不能在你按下快门前,就懂你想表达什么。准备换相机的朋友,建议多盯盯那些把AI视觉吃透的跨界玩家,传统大厂要是还端着参数架子,迟早被这波新浪潮拍在沙滩上。 谷歌 DeepMind 推出手语转文本模型,手语人工智能首次进入消费级应用 不管是给听障人士做手语翻译,还是帮摄影小白自动构图,这些花活儿能跑起来,全靠底层视觉算法在疯狂运转。这就不得不提它们处理数据的方式,也是现在端侧AI最性感的地方。 以前搞视觉识别,最让人心里发毛的就是隐私。你开个视频翻译软件,画面全传到云端服务器,万一泄露了怎么办。谷歌这次搞手语翻译,直接把原始视频流掐断在本地。他们的模型不传视频只传坐标,把手部和身体动作转化成一堆姿势特征点的位置信息,放弃了以往广泛使用的中间注释,直接在端侧解读空间信息。 影石搞那款颠覆认知的可换镜头相机也是这个底层逻辑。刘靖康说希望引入新技术,让不了解相机的普通用户也能轻松上手。要在端侧实时理解复杂场景、精准锁定主体,甚至彻底颠覆传统的对焦构图模式,没强大的本地多模态视觉算力根本玩不转。 以前厂商总喜欢把算力往云端搬,觉得这样能显得模型参数多大。现在风向彻底变了,真智能必须建立在本地化处理上。不传视频只传坐标,不仅把隐私安全感拉满,更解决了网络延迟的致命伤。你在镜头前比划手语,或者在街头抓拍瞬间,如果还要等云端返回结果,那体验直接灾难。 端侧AI视觉才是消费级硬件的终极形态。别被那些云端大模型的噱头忽悠了,买手机或者相机的时候,多看看本地NPU算力够不够硬。只有把计算留在设备里,把结果直接给到用户,这种不打折扣的真智能,才配得上我们掏出的真金白银。 技术逻辑理清了,回到现实,面对这些刚冒头的新概念,普通消费者到底该怎么捂紧钱包又不错过好戏。 先说避坑。别一听AI视觉就头脑发热去换手机。现在市面上很多主打AI影像的旗舰机,本质上还是靠云端算力在硬撑,或者搞些花里胡哨的AI消除和扩图,真到了端侧实时视频处理,本地NPU算力根本跟不上。至于相机圈,别指望传统大厂明天就能给你端出个完全不用懂参数的傻瓜微单。影石CEO都说了,那款颠覆认知的可换镜头相机还在研发,最快也得等明年CP+展会才能看到原型机。现在跑去买那些只是加了个AI滤镜的传统M43相机,纯粹是交智商税。 再说尝鲜。如果你或者身边的听障朋友想体验真正的无感交互,直接去更新Pixel系列手机上的Gboard和Live Transcribe。初期虽然只有美国手语,但那种对着镜头比划就能精准出字的端侧体验,绝对比现在那些需要联网翻译的半成品强太多。对于摄影小白,现阶段想尝鲜AI接管拍摄,不如先把手里的旧设备用到极致,或者去盯盯那些把端侧算力吃透的跨界玩家出的新物种。 买数码产品最怕的就是为PPT上的概念买单。现阶段的AI视觉硬件,真正能落地的端侧多模态交互还只是冰山一角。与其现在急着掏钱换那些半吊子AI设备,不如让子弹飞一会儿。等明年影石的原型机真机亮相,或者更多手机厂商把端侧视觉算力卷到标配,那才是我们真正该出手的时候。