让 AI 替你点鼠标:Computer Use 实战
别再手动搬砖了,看看 Gemini 3.5 Flash 和 AI Agent 怎么帮你操作电脑。
Gemini 3.5 Flash 上线 computer use,结合 OpenAI 的 Agent 趋势,我总结了 3 个让 AI 直接替你操作电脑的实战技巧,告别跨系统手动搬砖。
背景
老实说,以前用 AI mostly 是在对话框里复制粘贴。但最近我注意到一个明显的趋势:AI 开始长出手脚了。
Google DeepMind 刚发布了 Gemini 3.5 Flash 的 computer use 功能,这意味着模型可以直接看屏幕、移动鼠标、点击按钮。同时,OpenAI 也在探讨 Agent 如何彻底改变我们的工作方式。
这不再是“帮我写个脚本”的时代,而是“帮我直接去系统里把这事办了”。我花了不少时间测试这些新特性,总结了 3 个真正能落地的 Agent 操作技巧。
技巧一:跨系统数据“无脑”搬运
-
适用场景 你需要把 A 系统(比如某个没有 API 的老旧网页后台)的数据,手动抄到 B 系统(比如公司的内部 ERP 或 Excel)。
-
怎么做 以前你得自己写 Python 爬虫或者 Selenium 脚本,现在直接让 Gemini 3.5 Flash 接管浏览器。 你可以这样设定 workflow:先让 Agent 打开目标网页,识别特定的表格区域,然后切换到你的内部系统,逐个字段填入。 Prompt 参考:“请打开 [网址],找到‘本月报销单’列表,把前 5 条记录的金额和单号,依次填入当前打开的 ERP 系统的‘录入’页面,填完点击提交。”
-
注意事项 Computer use 在识别复杂 UI 时偶尔会点错。我建议在提示词里加一句:“每次点击提交前,截图让我确认一下”。
技巧二:自动化每日后台巡检与截图
-
适用场景 运营或运维同学每天要登录好几个后台,检查特定指标,截图发到群里。
-
怎么做 这种重复性极高的“看图说话”任务,简直是 Agent 的舒适区。 结合 OpenAI 提到的 Agent 改变工作 的理念,你可以把整个巡检流程封装成一个 Agent 任务。让 AI 自动登录、导航到数据看板、截取关键图表,甚至直接总结异常数据。 操作时,给 Agent 提供清晰的坐标或元素指引,比如“点击左侧导航栏的‘实时监控’,等待图表加载完成后截图”。
-
注意事项 登录环节往往有验证码。目前比较稳妥的做法是,你手动完成登录和验证码,然后再把控制权交给 Agent 执行后续巡检。
技巧三:在安全沙盒中运行 Agent 任务
-
适用场景 让 AI 直接操作你的主力电脑风险太高,万一它误删了文件或者点错了付款按钮就麻烦了。
-
怎么做 DeepMind 最近专门发文讨论了 保障 AI Agent 的未来安全,强调了实时监控和传统防护结合的重要性。 我的实战经验是:绝对不要在你的日常主力机上直接跑 Computer Use。 去开一个云桌面,或者在本地跑个虚拟机。把 Agent 限制在这个沙盒环境里操作。即使它“发疯”乱点,损失的也只是一个可以随时重置的虚拟环境。
-
注意事项 给 Agent 配置专门的子账号,权限降到最低,只开放它完成任务所必需的页面和按钮。
小结
从对话框到直接操作 GUI,AI 的边界正在快速扩张。如果你还在手动处理那些“没有 API 但必须做”的繁琐流程,真的建议试试 computer use。也许一开始它点鼠标还有点笨拙,但省下来的时间绝对香。