铭鸿体育资讯网

就着computer use这个话题再唠唠,我觉得这是Google后面弯道超车的好机会。Google的Gemini是原生多模态大模型,还有Chrome,Gmail,Google drive,Google map等一系列已经嵌入到日常生活工作的应用。 它手里最重要的筹码,恰恰是过去几年在Gemini上反复强化的原生多模态能力。 多模态之所以重要,是 ​

就着computer use这个话题再唠唠,我觉得这是Google后面弯道超车的好机会。Google的Gemini是原生多模态大模型,还有Chrome,Gmail,Google drive,Google map等一系列已经嵌入到日常生活工作的应用。

它手里最重要的筹码,恰恰是过去几年在Gemini上反复强化的原生多模态能力。

多模态之所以重要,是因为computer use首先是一个“感知—动作闭环”。模型必须看懂页面上的文字、图标、窗口层级和空间关系,把用户目标映射到准确的按钮与输入框;操作之后,还要比较前后画面,判断页面是否跳转、菜单是否展开、错误弹窗是否出现,再决定下一步。

它面对的不是一张静态图片,而是一段不断变化、带有因果关系的视觉序列。

虽然现在开起来OpenAI和A\占了上风,但Google拥有一条很清晰的追赶路径:用多模态缩小感知和动作差距,再用Chrome、Android与Workspace把能力快速推向真实用户。

消费级computer use最终比拼的,不只是模型能不能操作电脑,还包括用户是否愿意让它操作自己的电脑。多数普通人不会专门学习Agent、配置工具或重建工作流程,他们只希望Chrome替自己填完表格,Gmail整理邮件,Calendar找到合适时间。

Google在这个市场上的最大优势,可能不是最后几分模型成绩,而是它能把Agent包装成浏览器和办公软件原有功能的延伸。

对用户而言,这不是突然接受一个陌生的“数字员工”,而是原来使用的软件逐渐变得更能办事。AI仍然是工具,授权与确认仍然掌握在人手里,心理阻力也更小。

Google的生态还可以降低纯视觉操作的脆弱性。自有应用可以直接调用结构化能力,标准商业流程可以使用Universal Commerce Protocol等协议,只有没有接口的长尾网站才退回截图、点击和输入。

API负责高频、确定性任务,computer use负责兼容旧世界,多模态模型则在两者之间理解页面与用户意图。这种混合执行比从头到尾模仿鼠标操作更快、更便宜,也更容易管理身份、权限和执行结果。

这才是Google可能追上OpenAI和Anthropic的完整因果链:

原生多模态提供视觉与空间理解,Agent后训练把理解转化成动作,Chrome和Android提供运行环境,Workspace与Google账号提供上下文和身份,庞大的产品入口负责分发。

单独看任何一层,Google都未必形成绝对优势;这些能力叠在一起,却可能让它比独立模型公司更快跨过消费级Agent的“足够好”门槛。

所以,判断Google能否追上,既要看Gemini能否保持多模态与空间推理优势,也要看Auto Browse能否从演示变成高频使用,跨应用任务能否连续完成,以及用户是否愿意长期授予身份和操作权限。

只看模型跑分会低估Google,只看分发同样会高估Google。它必须把已经形成优势的“看懂世界”,真正变成稳定的“在世界里完成任务”。

OpenAI和Anthropic正在把Agent塑造成一种新产品,Google则有机会让Agent逐渐消失在原有产品里。多模态能力决定它能否看懂用户正在做什么,Chrome与Workspace决定这种能力能否无摩擦地进入日常工作。当两者闭合,Google追赶的就不再只是computer use模型,而是整个消费级Agent入口。