一台电脑,可以同时拥有两个主人吗?
过去一两年,AI Agent从概念走向产品,开始能够操作键盘、鼠标,让人类看着AI“上班”逐渐成为现实。但当AI真正开始执行任务时,一个新的问题也随之出现:AI工作的时候,人还要让出自己的电脑吗?如果任务需要持续几个小时甚至一整夜,人还需要一直在线吗?
近期,豆包工作任务密集更新,呈现了人机协同工作的更多可能。
豆包推出虚拟桌面,并支持本地电脑、云电脑双模式和手机远程操作。人可以继续在自己的桌面写稿、处理文件,AI则在另一块虚拟桌面里整理资料、打开网页、执行任务;需要长时间运行的工作,也可以交给云电脑持续完成。
一边是人的工作,一边是AI的工作;一边是人的电脑,一边是AI的工作空间。两者不必再争夺同一块屏幕,也不必共享同一段工作时间,一台电脑开始真正容纳两个同时工作的“主人”。
先给AI一块自己的“桌面”
打开豆包,选中工作模式,在技能栏口选中“操作电脑”,输入相关任务指令后,豆包虚拟桌面就可以像人一样查看并操作电脑屏幕、鼠标和键盘。
比如,整理桌面、文件排序等。
输入指令,把桌面49个文件按类型归类,并移入新建的文件夹里,再把图片按照文件大小排列并重新命名。
在豆包整理桌面、排序文件的时候,会搭建一个安全的沙箱环境,系列操作也在虚拟桌面完成,在豆包操作的同时,也可以正常浏览并使用电脑进行工作。
这类工作并不复杂,却具有典型的重复性:规则明确、耗时分散,又需要人不断点击、确认。AI接手的并不是某一个文件,而是一整段机械操作。对于日常办公而言,这意味着一些低价值的数字劳动,可以从人的工作流程中被进一步剥离出来。
据介绍,豆包虚拟桌面基于更通用的GUI(图形用户界面)能力,模型在没有MCP、API、插件和CLI的情况下也能看懂界面并完成操作,支持在不干扰用户的环境中操作应用、浏览网页并完成跨软件任务,不会抢占用户的鼠标、键盘或打断当前工作。
通过虚拟桌面,用户可以实时查看豆包的操作过程,需要时也可以随时暂停、接管任务。
有了自己的桌面,AI能做的就不只是整理文件。
我们要求豆包自行打开网页,检索近期上海城市活动,阅读页面信息,筛选有效内容,并整理成清单表格,最后生成一个含有活动图片的PPT介绍,并保存在桌面。
GUI能力的意义正在这里显现,AI进入电脑的条件,不再完全取决于软件是否为它提供专门接口,而是开始具备理解和操作现有数字界面的能力。
对于用户而言,意味着可以把更多原本需要自己逐步操作的电脑任务,直接交给Agent完成;对于Agent而言,则意味着工作边界从特定工具和标准化场景,进一步向更广泛的真实电脑环境延伸。
再给AI一段自己的“工作时间”
如果说虚拟桌面解决的是AI和人“在哪儿工作”,那么云电脑解决的,则是“什么时候工作”。
我们让豆包定时检查新闻网站页面,每隔15分钟监控一次,一旦出现新内容,就记录标题、发布时间和链接,存入桌面的文档,并及时提醒。任务交给云电脑后,即使人离开电脑,豆包仍可以持续运行,在手机上也能收到任务更新的提醒。
更进一步,设置一个隔夜盯盘的任务,让豆包按照固定频率检查页面变化,记录时间、数据和异常情况,触发预设条件后提醒。晚上把任务交出去,合上电脑,第二天再通过手机查看运行记录,和监控报告。
按照官方介绍,豆包云电脑模式提供独立的云端工作环境,支持持久在线,适合持续运行、定时触发等任务。与此同时,手机端可以随时查看进展、追加要求或打断任务。
除了虚拟桌面和云电脑,豆包此次更新还增加了手机远程操作和侧边工作台。
手机端可以查看任务状态、追加要求或打断任务。PC端侧边工作台则可以集中承载本地文件、飞书文档、网页等任务资源,并统一查看任务过程中生成的文件、图片等内容。
从实际使用看,这几项能力共同解决的是Agent进入真实工作场景后的一个关键问题:任务开始之后,人不必一直在线,但又不能完全失去控制。
云电脑让AI可以持续运行,手机保留了人的介入权,侧边工作台则让任务过程和结果有了更清晰的承载空间。更重要的是,人和AI的工作时间由此不必完全重合:人负责提出目标、判断结果,AI可以在人的工作间隙继续执行。
这让人机协作开始具备了“异步协作”的特征——不要求双方同时在线,也不要求人在每一个操作节点介入。对于需要持续监测、信息采集、批量处理等任务而言,AI真正接手的,不只是几次点击,而是一段可以独立运行的工作时间。
如何进入真实的工作流程
豆包这轮更新,值得关注的不只是增加了哪些功能,而是字节过去几年在模型、GUI Agent和云端基础设施上的积累,开始在具体产品中形成连接。
从公开资料看,Seed系列模型正持续向复杂任务执行发展。Seed 2.0系列将Agent能力作为重要升级方向,Seed模型页也将Seed 2.1定位为面向真实世界生产力的Agent。与此同时,UI-TARS等项目持续探索让模型理解并操作真实的电脑、手机界面。
这些技术能力在豆包工作任务中进一步被组合起来:模型理解任务,GUI完成电脑操作,虚拟桌面提供独立的操作空间,云电脑则为需要持续运行的任务提供环境,手机端保留远程查看和介入的入口。
从这个角度看,Agent真正进入工作场景,需要解决的问题已经不只是“会不会做”,还包括在哪里做、怎么持续做,以及人在什么时候介入。
下一篇:没有了