metayu
知识卡片2026-06-25·阅读 5 分钟

用 Gemini 3.5 Flash 搞定桌面自动化

别再手写 RPA 脚本了,试试让 AI 直接操作你的电脑。

Gemini 3.5 Flash 新增了 Computer Use 功能。我实测了三个自动化场景,并结合 DeepMind 的 Agent 安全路线图,总结了防翻车的实操经验。

背景

最近 AI 圈的动作挺密集的。OpenAI 那边在搞 Broadcom Jalapeno 推理芯片Daybreak 安全项目,硬件和安全两手抓。不过对我来说,最让我兴奋的还是 Google DeepMind 发布的 Gemini 3.5 Flash 引入 Computer Use 功能。

老实说,以前搞桌面自动化,写 Python 脚本或者用传统 RPA 工具,遇到个弹窗或者 UI 改版就得重写代码,心很累。现在大模型能直接“看”屏幕并操作鼠标键盘了。我花了一周时间把玩这个新特性,结合 DeepMind 刚发的 AI Agent 安全控制路线图,摸索出了一套还算靠谱的桌面自动化 workflow。今天直接分享三个最实用的实战技巧。

技巧一:跨软件的数据“无脑”搬运

  • 适用场景 你需要把 Excel 里的几百条客户信息,逐条录入到一个没有 API 接口的老旧内部 ERP 系统里。

  • 怎么做 传统方式你得用 Selenium 或者 PyAutoGUI 去定位输入框的 XPath,一旦 ERP 系统前端稍微改个版,脚本直接报废。 用 Gemini 3.5 Flash 的 Computer Use,你只需要给它一个明确的 Prompt:“打开桌面的客户名单.xlsx,读取第一行,然后打开浏览器里的 ERP 系统,把姓名填到‘客户名称’框,电话填到‘联系方式’框,点击保存。完成后循环处理下一行。” 模型会自己识别屏幕上的输入框位置。我测试下来,即使 ERP 系统的按钮换了颜色或者位置偏移了几个像素,它也能准确点中。

  • 注意事项 别一次性让它处理太多行。我试过让它一口气跑 500 条,跑到第 40 条的时候它偶尔会“幻觉”,把电话填到备注里。建议每 10 条加一个确认节点,或者在 Prompt 里强制要求它每完成一条就输出一次日志。

技巧二:给自动化 Agent 加上“安全护栏”

  • 适用场景 让 AI 帮你自动清理邮箱、整理文件夹,或者在浏览器里自动点击一些确认按钮时,防止它误删重要文件或乱点广告。

  • 怎么做 AI 操作电脑最怕的就是“失控”。DeepMind 在 保障 AI Agent 的未来 里提到了 AI Control Roadmap,核心就是结合传统防护和实时监控。 我在实操中借鉴了这个思路,做了一个“沙盒+白名单”的 workflow。 第一步,在虚拟机或者受限的本地账户里运行 Computer Use,物理隔离你的核心数据。 第二步,在系统层面写一个简单的 Python 拦截脚本,监控鼠标点击事件。如果点击坐标落在了“删除”、“支付”或者“清空”这类危险按钮的区域内,直接拦截并暂停 Agent,要求人工介入。

  • 注意事项 不要完全依赖大模型自己的“拒绝”能力。有时候 Prompt 注入或者上下文太长,模型会忘记安全指令。系统级的硬拦截才是最稳的。

技巧三:搞定动态渲染的复杂网页抓取

  • 适用场景 抓取那些反爬严重、数据靠 JavaScript 动态渲染、甚至需要滑动验证码的网页信息。

  • 怎么做 写爬虫遇到这种网站简直是噩梦。现在你可以直接把浏览器窗口交给 Gemini 3.5 Flash。 我的做法是:先让模型打开目标网页,然后下达指令:“滚动页面到底部,等待新内容加载。如果看到‘点击加载更多’,就点它。把页面上所有带有‘2026’字样的项目标题和链接提取出来,保存为 JSON。” 因为它具备视觉理解能力,所以能像真人一样判断页面是否加载完毕,甚至能尝试拖动简单的滑块验证码。这比你去逆向分析网站的加密参数要快太多了。

  • 注意事项 Computer Use 的推理速度比直接调 API 慢不少,毕竟要截屏、分析、再执行。如果是需要毫秒级响应的抢票或者高频交易场景,这招不适用。它更适合那种“不在乎多等几分钟,但人工做极其繁琐”的长尾任务。

小结

用大模型直接操作电脑,确实改变了我们做自动化的思路。不用再去死磕 DOM 树和 XPath 了,用自然语言描述意图就行。不过,能力越大,翻车的风险也越大。把 DeepMind 强调的实时监控和传统安全策略结合起来,你的 Agent 才能真正成为靠谱的赛博打工人。

分发工具

相关文章