实测 Gemini 3.5 电脑操作及 3 个提效工作流
别再手动搬砖了,用最新的 Computer Use 和轻量模型搞定自动化。
实测 Gemini 3.5 电脑操作,结合 Nano Banana 2 Lite 和 GeneBench Pro,分享 3 个真实的自动化与数据处理工作流。
背景
老实说,之前看到各种“AI 操作电脑”的演示,我总觉得离落地还差口气。直到最近 Google DeepMind 发布了 Introducing computer use in Gemini 3.5 Flash,我花周末时间搭了几个 demo,发现这玩意儿真的能用来干脏活累活了。
结合最近 DeepMind 和 OpenAI 的其他几个更新,我整理了 3 个我觉得最实用的工作流。不管你是想搞定跨软件的自动化,还是处理复杂的专业数据,这篇应该能给你点启发。
技巧一:用 Gemini 3.5 Flash 搞定跨应用 GUI 自动化
-
适用场景 你需要把 A 系统(比如一个没 API 的老旧内部后台)的数据,搬到 B 系统(比如本地 Excel 或 Notion)。传统方式要么写脆弱的 RPA 脚本,要么纯手工复制粘贴。
-
怎么做
- 准备环境:给 Gemini 3.5 Flash 接入屏幕截图和鼠标/键盘控制权限(可以用现成的 Python 库如
pyautogui配合)。 - 设定 Prompt:别只说“把数据填进去”,要拆解步骤。比如:“截取当前屏幕,找到‘导出’按钮并点击,等待弹窗出现后,将文件保存到桌面。”
- 循环执行:让模型每次操作后重新截图,确认状态再执行下一步。
- 注意事项
坑很多。首先,屏幕分辨率或缩放比例一变,坐标就全乱了,建议在 Docker 或固定分辨率的虚拟机里跑。其次,遇到加载慢的网页,模型可能会 impatient(不耐烦)地重复点击,记得在代码里加个硬性的
sleep或者让模型识别“加载动画”。
技巧二:Nano Banana 2 Lite 与 Omni Flash 的“大小脑”协同
-
适用场景 做实时多模态应用(比如流水线瑕疵检测、实时视频流分析),全用大模型太贵且延迟高,全用小模型又不够聪明。
-
怎么做 参考 Start building with Nano Banana 2 Lite and Gemini Omni Flash 的思路,我搭了一个“大小脑”架构:
- 前置过滤(小脑):用 Nano Banana 2 Lite 处理高频视频帧,只做简单的“是否有异常”二分类。这模型轻量,跑起来飞快。
- 深度分析(大脑):一旦 Lite 模型发现疑似异常,立刻把这几帧抽出来,扔给 Gemini Omni Flash 做详细的多模态推理,输出具体的瑕疵类型和位置。
- 注意事项 Nano Banana 2 Lite 的上下文窗口和复杂推理能力有限,别指望它干重活。把它当成一个“触发器”用,效果最好。另外,两个模型之间的数据传递格式要统一,不然解析会报错。
技巧三:用 GeneBench Pro 验证复杂数据管道
-
适用场景 如果你在做生物信息、医疗或者任何需要处理极高复杂度、长序列科学数据的项目,自己写的数据清洗管道很容易出暗病。
-
怎么做 OpenAI 最近推了 GeneBench Pro,还附带了详细的 Case Studies。
- 别直接拿它当生产工具,先把它当“考官”。
- 把你现有的数据处理脚本跑一遍,把输出结果喂给 GeneBench Pro 进行基准测试。
- 对比它给出的评估指标,找出你管道里丢失精度或产生幻觉的环节。
- 注意事项 这工具专业性极强,普通 CRUD 业务用不上。而且,即使是 Pro 版本,在处理极端边缘的基因序列变异时也可能翻车。我建议你一定要保留人工抽检环节,千万别完全黑盒化。
小结
现在的 AI 工具早就过了“只能聊天”的阶段。Gemini 3.5 Flash 的 Computer Use 让 AI 长了手脚,Nano Banana 2 Lite 让端侧部署更便宜,而 GeneBench Pro 则拔高了专业领域的上限。
如果你和我一样,平时被各种琐碎的跨系统操作折磨,强烈建议先从第一个 GUI 自动化技巧试起。用了几天感觉,真的能省下不少喝奶茶的时间。