metayu
知识卡片2026-06-25·阅读 4 分钟

用 Gemini 3.5 Flash 搞定桌面自动化

别再写 RPA 脚本了,试试让 AI 直接操作你的电脑。

Gemini 3.5 Flash 上了 Computer Use 功能。我实测几天,总结了 3 个实用的自动化工作流,顺便聊聊怎么给 Agent 加安全护栏防乱点。

背景

老实说,之前用各种 RPA 工具写自动化脚本,最烦的就是处理那些没有 API 的老旧内部系统。DOM 结构一变,脚本就废了。

最近看到 Google DeepMind 发布了 Introducing computer use in Gemini 3.5 Flash,我第一时间去试了试。和以前那种只能生成代码的模型不同,这次它是真的能“看”屏幕并直接控制鼠标键盘。

结合他们同期发布的 Securing the future of AI agents 里的安全控制思路,我摸索出了几个还算靠谱的实战用法。如果你也受够了脆弱的自动化脚本,可以看看下面这几个工作流。

技巧一:用自然语言搞定跨系统数据搬运

  • 适用场景 需要把 A 系统(比如某个没接口的老旧 ERP)的数据,手动复制粘贴到 B 系统(比如在线表格),且页面元素经常变动的情况。

  • 怎么做 传统方式你得用 Selenium 去定位 XPath,现在直接给模型下指令。

  1. 在提示词里明确起点和终点:“打开内部 ERP 的订单页面,把今天状态为‘已发货’的订单号,逐行填入右侧打开的表格 A 列。”
  2. 让模型先“观察”屏幕。我习惯加一句“先截图确认当前页面元素,告诉我你打算点哪里”,这能大幅降低它乱点的概率。
  3. 执行动作。模型会自己移动鼠标、点击、复制、切换窗口、粘贴。
  • 注意事项 别让它一次性处理几百条数据。我测下来,单次任务控制在 20 条以内最稳。如果页面加载慢,一定要在 prompt 里加上“每次点击后等待 2 秒,确认页面刷新再继续”。

技巧二:给 Computer Use Agent 套上“安全护栏”

  • 适用场景 让 AI 帮你操作电脑时,最怕它突然“幻觉”发作,给你发个邮件或者删个文件。

  • 怎么做 DeepMind 在那篇关于 AI agents 安全 的文章里提到了 AI Control Roadmap,核心就是传统护栏加实时监控。我们可以把这个思路平移到 Computer Use 里。

  1. 物理隔离:我专门搞了个虚拟机来跑这些 Agent,绝不给本机最高权限。
  2. 动作白名单:在系统提示词里写死边界。比如:“你只能操作浏览器和 Excel,绝对不允许打开邮件客户端。如果看到无关窗口,立刻停止。”
  3. 引入人工确认:对于涉及“提交”、“删除”的按钮,要求 Agent 在点击前必须暂停,弹窗让你点确认。
  • 注意事项 不要过度依赖模型自身的“道德约束”。它不点删除键,不是因为懂事,而是因为你的系统级拦截脚本挡住了它。

技巧三:让 AI 充当“无情”的 UI 走查员

  • 适用场景 产品上线前,需要人工点点点测试各种边缘交互,或者检查多语言下的 UI 错位。

  • 怎么做 以前这都是 QA 团队的苦力活。现在你可以让 Gemini 3.5 Flash 来当测试员。

  1. 给它一份简单的测试用例清单。
  2. 让它按照清单在测试环境里操作:“尝试用空密码登录”、“在购物车里输入负数”、“把浏览器窗口缩到最小看看导航栏会不会重叠”。
  3. 要求它每发现一个异常,就自动截图并记录当前坐标和复现步骤。
  • 注意事项 AI 对“视觉美观”的判断还是有点主观。我建议你只让它做“功能逻辑”和“明显 UI 崩溃”的走查,别让它去评价“这个按钮颜色好不好看”。

小结

用大模型直接操作电脑,感觉就像雇了个不需要休息的实习生。虽然 Gemini 3.5 Flash 的 Computer Use 还有点慢,偶尔也会点错位置,但比起维护那些脆弱的 RPA 脚本,这点时间成本完全值得。记得把安全护栏做扎实,剩下的就交给它去点吧。

分发工具

相关文章