GLM-5.3意见征集:评论区为何死磕视觉?
AI 新闻热点
GLM-5.3
智谱AI
多模态大模型
唐杰
AI视觉
智谱唐杰刚在社交平台为GLM-5.3征集意见,浏览量瞬间破40万,评论区却出奇一致地指向同一个痛点:视觉能力。刚开源的GLM-5.2在编程和逻辑推理上表现抢眼,但纯文本的设定让很多开发者在实际场景中束手无策。本文拆解这场视觉之痛背后的用户诉求与厂商理念拉扯,探讨在对手纷纷推出原生多模态的当下,智谱该如何平衡AGI的星辰大海与开发者的现实需求。
昨天刚畅聊完AI终局是猎龙游戏,智谱唐杰今天就发帖征集GLM-5.3意见。一句“你来定”,浏览量瞬间干到40多万。
本以为评论区会是一场关于AGI架构的高深探讨,结果点进去一看,满屏都在死磕两个字:视觉。
开发者们这次是真急眼了。愿望清单里虽然也有Agent能力和超长上下文,但呼声最高、最整齐的,全是要模型长眼睛。有人甚至直接喊话,求做个能看截图的桌面应用。
这其实折射出一种很现实的撕裂。唐杰盯着的是第一性原理,是模型智能的天花板。他觉得当下的多模态对提升AGI智能上界帮助有限。但开发者根本不关心你的智能上限在哪,他们只在乎贴张图模型能不能接住,截个屏能不能看懂。
科学家追求AGI的星辰大海没毛病,但大模型厂商在死磕智能上限的同时,必须正视开发者对多模态等实用能力的迫切需求。你文本推理再强,看不懂一张前端设计稿,干活的人照样掀桌子。无视这种基本盘的呼声,等对手把原生多模态卷成标配,再想补课可就真晚了。
两周前刚开源的GLM-5.2,编程能力确实猛,干到了开源界第一、全球第二,仅次于神话级的Fable-5。这成绩单拿出去绝对有面子。但现实很骨感,它是个纯文本模型。百万Token上下文玩得溜,深度推理也没得挑,偏偏没搭载视觉编码器。
前端开发拿着设计稿截图想让它直接吐代码,运营丢个数据图表想让它写分析,模型只能干瞪眼回一句看不到。这谁顶得住?隔壁对标的Fable-5可是原生多模态,看图写码一条龙。用户看着眼馋,心里能没落差吗?
其实智谱不是做不出视觉。他们搞过GLM-5V-Turbo,也出过CogVLM,唐杰自己发的视觉论文更是一抓一大把。核心问题在于,他们没把视觉塞进最强旗舰里。在唐杰的视角里,当下的多模态对提升AGI智能上界帮助有限,不如文本和多模态分开发展。
这种科学家视角的克制,在开发者眼里就是实打实的难用。大模型厂商死磕AGI上限固然重要,但如果不顾开发者对多模态的刚需,只盯着天花板,基本盘迟早被那些既能仰望星空又能低头看路的对手抢光。
其实智谱这种偏科背后,藏着典型的科学家思维。去年底的大模型年终总结上,唐杰就把话挑明了。他先肯定多模态是未来,但紧接着就泼了盆冷水:当下的多模态对提升AGI的智能上界,帮助有限。在他看来,最有效的方式还是文本、多模态、多模态生成分开发展。
你品品这话里的潜台词。在唐杰这种冲在AI一线的科学家眼里,第一性原理永远是模型智能本身。视觉确实能让模型更好用,但要让模型真正变聪明,靠的还是复杂推理这种硬功夫。他们盯着的是智能的天花板,觉得视觉顶多算个锦上添花的配件。
但这套逻辑,放到真实的开发场景里就完全水土不服了。AGI的终局对每天赶进度的打工人来说太遥远。前端工程师不在乎你的模型能不能解开哥德巴赫猜想,他只在乎丢一张UI设计稿过去,模型能不能直接吐出能跑的代码。运营也不关心你的上下文窗口有多长,他们只想知道截个数据图表,模型能不能一眼看懂并写出分析。
这就是最真实的拉扯。一边是科学家死磕AGI的星辰大海,一边是开发者在泥坑里呼喊一个能看截图的实用助手。大模型厂商追求技术上限绝对没毛病,但如果无视开发者对多模态等实用能力的迫切需求,基本盘迟早要出问题。文本推理再强,连张截图都看不懂,干活的人照样会掀桌子换模型。死磕智能上限的同时,必须正视这些看似不起眼的实用需求,不然等对手把原生多模态卷成标配,再想回头捡流失的用户可就真来不及了。
别光在内部纠结第一性原理了,抬头看看外面的竞争环境,对手早就把原生多模态卷成了标配。Kimi K2.5今年1月就上了原生多模态,Qwen3.5-Omni三月份直接把文本、图像、音频、视频端到端统一。再看国际上的Gemini 3,文图音视频一把抓,生态体验早就拉满了。
智谱还在拿多模态对AGI上界帮助有限当挡箭牌,对手已经用原生多模态把开发者的痛点解决得明明白白。以前大家比的是谁文本推理强,现在比拼的是谁能一口气把图文音视全吃透,这背后拼的更是算力调度和工程落地的硬实力。市场根本不等人,开发者更是直接用脚投票。你纯文本能力再强,连张前端截图都看不懂,用户转头就去用隔壁能看图说话的模型了。
追求AGI上限是科学家的浪漫,但留住基本盘才是厂商的现实。大模型厂商在追求AGI智能上限的同时,必须正视开发者对多模态等实用能力的迫切需求。无视这种刚需,等对手把多模态卷成行业基建,再想回头捡流失的用户可就真晚了。GLM-5.3把视觉补齐已经是迫在眉睫的事,别光盯着AGI的星辰大海,先把开发者脚下的泥巴填平才是正经路。
科学家有科学家的浪漫,但做产品终究得接地气。AGI确实是终局,可如果连眼下的开发者都留不住,拿什么去熬到猎龙游戏胜利的那一天?
现在大模型竞争早就进入了深水区,算力瓶颈卡着所有人的脖子。在这种时候,算力再猛,如果核心场景跑不通,纯粹就是烧钱听响。开发者才是大模型的基本盘,他们每天在泥坑里赶进度,需要的是能直接看截图、写代码的趁手工具,而不是一个只会做复杂推理却看不懂UI设计稿的最强大脑。
以前大家拼参数规模、拼榜单跑分,现在拼的是生态闭环和落地体验。对手们已经把原生多模态做成了行业基建,智谱要是还端着科学家的架子,觉得视觉只是锦上添花,迟早会被市场教做人。
GLM-5.3接下来的路其实很清晰。别光顾着在文本推理的象牙塔里死磕,赶紧把视觉能力原生融合进旗舰基座里。让前端能直接传设计稿,让运营能直接丢数据图表。把开发者脚下这摊泥泞的烂路填平,给他们真正好用的武器,他们才愿意买票陪你一起去仰望AGI的星辰大海。这就是现实。