Chrome 149升级框选交互,AI接管屏幕
AI 新闻热点
Chrome 149
Gemini 3.5 Flash
Computer Use
AI Agent
屏幕交互
谷歌悄悄给Chrome 149推了个“Select from screen”功能,配合升级的Gemini 3.5 Flash模型,直接在浏览器里搞起了屏幕级交互。以前问AI还得复制粘贴或者截图,现在光标一框,网页里的鞋款、图表直接扔给大模型。这不仅是给Google Lens加了个对话壳子,更是Gemini“Computer Use”能力落地的前奏。当AI从陪聊变成能帮你填表、点按钮的数字员工,浏览器这个入口的玩法彻底变了。别光看着,赶紧更新浏览器试试框选功能,体验下不用切屏的爽感。
谷歌最近给Chrome 149推了个更新,上线了Select from screen功能。以前我们在网页上看到复杂的图表,或者想对比几双运动鞋,想问AI就得老老实实复制粘贴,或者截图再上传。现在完全不用这么折腾。
在Chrome的Gemini侧边栏点击Ask Gemini,打开Add菜单里的加号,系统会直接高亮当前标签页。你用鼠标框选想问的图片、图表或者某段文字,内容就会自动附加到提示词里发给大模型。这操作看着有点像Google Lens,但本质区别在于,Lens是把你拽回传统的搜索结果页,而这是把屏幕内容直接喂给对话式AI。
这功能看似只是省去了复制粘贴的麻烦,实际上改变了信息传递的效率。大模型不再只能处理你复制下来的纯文本,而是能精准理解你鼠标圈出来的那块屏幕上下文。不管是让AI帮你分析财报里的某个具体数据,还是解释某段晦涩的代码,信息损耗被降到了最低。
别小看这个简单的框选动作,这正是AI从对话框走向全屏幕操作的实质性一步。当大模型能无缝理解你视线所及的屏幕区域时,它才算真正开始从聊天工具向干活的数字助理进化,后续那些复杂的自动化操作也就水到渠成了。
如果你以为Chrome 149只是加了个高级截图工具,那就把谷歌想浅了。前端框选解决了让AI精准看的问题,而真正让AI动手干活的,是背后Gemini 3.5 Flash原生引入的Computer Use能力。
以前我们使唤AI,顶多是让它生成个文案、写段代码,或者在对话框里跟你来回拉扯。现在Gemini 3.5 Flash直接拿到了屏幕控制权。它能跨越网页、桌面和移动端环境,替你访问复杂网站、填写那些长得反人类的长表单、精准点击按钮,还能自动收集散落的数据。这早就不止是看图说话或者文本生成了,这是实打实的屏幕接管。
结合前面的框选功能,整个逻辑就闭环了。当你在网页上框选几双运动鞋问AI哪款好,以前它只会甩出一堆文字建议让你自己去挑。现在有了Computer Use的加持,它不仅能给出专业分析,还能直接帮你把筛选条件填进购物车,甚至自动去几个比价网站抓取实时折扣。AI Agent在真实场景里的落地,靠的就是这种从动嘴到动手的跨越。
大模型卷到现在,光会陪聊已经不够看了。谁能率先把触角伸进用户的操作系统和浏览器底层,替用户把那些繁琐的点击和输入全干了,谁才能真正坐上下一代流量入口的王座。谷歌这波前后端联动,算是把AI Agent的底牌亮出来了,接下来就看友商们怎么接招。
以前我们总觉得浏览器只是个看网页的工具,手机App才是王道。但打工人心里清楚,真正干复杂活、处理重度业务的地方,全在电脑屏幕的浏览器里。谷歌把Computer Use直接塞进Chrome,等于在流量最大、场景最丰富的入口安插了个超级管家。浏览器正在从单纯的内容载体,蜕变成AI Agent的底层操作系统。
回想以前用AI,大家基本都是开个对话框,一问一答,顶多把它当成个高级点的搜索引擎。现在情况变了,AI直接长在浏览器里,看着你的屏幕,替你点鼠标、填表单。这就意味着,浏览器成了AI执行任务的实体手脚。那些还在把AI当成聊天机器人死磕的厂商,确实没看清形势。别只把AI当聊天工具了,它得能下场干活才行。
浏览器掌握着用户最真实的操作意图和上下文。你在电商网站框选商品比价,在企业后台处理长表单,这些高价值的真实场景全在浏览器里发生。谁拿下了浏览器的AI交互标准,谁就掐住了下一代Agent的脖子。大模型卷参数固然重要,但能把AI无缝揉进用户每天必用的浏览器里,让它在真实业务流里跑起来,才是建立护城河的真本事。
别再盯着那个孤零零的聊天对话框了。未来的AI竞争,拼的不是谁更能陪聊,而是谁能在你敲键盘、点鼠标的时候,神不知鬼不觉地把繁琐的活干完。浏览器这个看似传统的入口,正借着AI Agent的东风完成进化。跟不上这波从动嘴到动手节奏的玩家,迟早会在下一代交互革命中被边缘化。