让 AI 替你点鼠标:Gemini 电脑控制实战
告别机械的复制粘贴,用 Gemini 3.5 Flash 和端侧模型重塑你的桌面工作流。
最近 Google DeepMind 推出了 Gemini 3.5 Flash 的电脑控制功能和轻量级端侧模型。我试了下,发现它们在自动化数据搬运和本地隐私处理上真的香,本文分享三个实战技巧。
背景
老实说,每天在不同系统间复制粘贴数据,真的挺折磨人的。最近看到 Google DeepMind 发布了 Gemini 3.5 Flash 的 computer use 功能,还有 Nano Banana 2 Lite 和 Gemini Omni Flash 这两个轻量级模型,我立刻去试了试。
以前我们总觉得 AI 只能聊天或者写代码,但现在它真的能“长出手”来操作你的电脑界面了。结合端侧小模型,很多原本需要写复杂 RPA 脚本的活儿,现在几句 prompt 就能搞定。
技巧一:用 Computer Use 搞定跨系统“数据搬运”
-
适用场景 你需要把 ERP 系统里的几十条订单状态,手动核对并录入到另一个没有 API 接口的老旧内部系统里。
-
怎么做 传统方式你得自己写 Selenium 脚本,或者用按键精灵,调试各种元素定位,心累。现在你可以直接调用 Gemini 3.5 Flash 的 computer use 能力。 我建议你直接给它这样的指令:“打开浏览器访问内部系统,登录并进入订单录入页面。然后打开桌面上的 orders.csv,逐行读取订单号,在系统中搜索并更新状态为‘已发货’,如果遇到弹窗就点击确认。” AI 会像真人一样去识别屏幕上的按钮、输入框,甚至处理加载延迟。
-
注意事项 别让它一次性处理太多数据。我觉得先跑 5 条做个 dry run(空跑)最稳妥,确认它点的位置没偏,再放开跑。
技巧二:用 Nano Banana 2 Lite 做本地敏感文档脱敏
-
适用场景 法务或 HR 经常要处理包含大量个人隐私的合同或简历,传到云端 AI 怕泄露,本地跑大模型又带不动。
-
怎么做 这时候 Nano Banana 2 Lite 这种端侧小模型就派上用场了。它体积小,完全可以在你的笔记本本地运行,断网也能用。 你可以写个简单的 Python 脚本,把文档按段落喂给本地模型,prompt 设为:“提取这段文本中的人名、电话和身份证号,并替换为 [NAME]、[PHONE]、[ID],只输出替换后的文本。” 处理完脱敏数据,再丢给云端大模型做深度分析。
-
注意事项 小模型的上下文窗口和逻辑推理能力肯定不如云端大模型。如果文档格式特别复杂,它可能会漏掉一些信息,建议配合正则表达式做双重校验。
技巧三:结合 Omni Flash 进行 UI 自动化走查
-
适用场景 前端开发或测试人员需要检查几十个页面的 UI 渲染是否正常,有没有元素重叠或错位。
-
怎么做 人工一个个点开看太费眼了。你可以利用 Gemini Omni Flash 的多模态能力和 computer use 结合。 让 AI 控制浏览器遍历你的测试环境页面,每打开一个页面就截个图。然后把截图喂给 Omni Flash,prompt 这么写:“检查这张网页截图,找出所有文字重叠、按钮未对齐或图片加载失败的 UI 缺陷,并给出坐标和修复建议。” 这比单纯靠代码跑视觉回归测试要灵活得多,因为它能理解“什么是正常的 UI 布局”。
-
注意事项 截图分辨率别太高,不然 token 消耗太快。我觉得 1080p 压缩到 720p 足够 AI 识别 UI 瑕疵了。
小结
AI 正在从“对话框”走向“操作系统”。不管是用 Gemini 3.5 Flash 替你点鼠标,还是用端侧模型守住数据隐私,核心都在于把 AI 当成一个真正的“数字实习生”。别总想着让它一步到位,给它明确的步骤和容错空间,你会发现工作流顺畅很多。顺便提一句,如果你关注生物信息学,OpenAI 最近发的 GeneBench Pro 也挺有意思,不过那是另一个垂直领域的故事了。