知识卡片2026-07-09·阅读 4 分钟
用 Gemini 3.5 Flash 搞定电脑自动化
手把手教你用最新 AI 模型操作电脑和写轻量代码。
最近 Google DeepMind 更新了 Gemini 3.5 Flash 的 computer use 功能,还带了两个新轻量模型。我试了下,用来做桌面自动化和快速开发真的很香。这篇教你怎么落地。
背景
最近看官方更新,Google DeepMind 动作挺大。特别是 Gemini 3.5 Flash 引入了 computer use,还有 Nano Banana 2 Lite 和 Gemini Omni Flash 这两个新模型。另外 OpenAI 也发了篇关于 编程评估去噪 的文章。
老实说,以前用 AI 操作电脑总是卡在各种 UI 识别上,这次我花了不少时间测试 Gemini 3.5 Flash 的 computer use,感觉终于能跑通一些真实的自动化工作流了。
技巧一:用 Gemini 3.5 Flash 接管重复性桌面操作
-
适用场景 每天要登录后台导出报表、或者在多个系统间复制粘贴数据。
-
怎么做
- 接入 Gemini 3.5 Flash 的 computer use 接口。这个功能让模型能直接“看”屏幕并执行点击、输入。
- 给模型下达明确的任务指令,比如“打开浏览器,登录后台,下载昨天的销售报表”。
- 让模型先输出一遍执行计划,确认无误后再让它实际控制鼠标和键盘。
- 注意事项 别让它一步到位。我测试时发现,如果任务太长,它偶尔会点错位置。把大任务拆成“打开网页”、“输入密码”、“点击导出”几个小步骤,成功率会高很多。
技巧二:用 Nano Banana 2 Lite 做端侧轻量级原型
-
适用场景 想快速验证一个想法,或者需要在资源受限的设备上跑个小工具。
-
怎么做
- 选用 Nano Banana 2 Lite。看名字就知道它主打轻量和速度。
- 用它来生成基础的前端页面或简单的本地数据处理脚本。
- 配合 Gemini Omni Flash 处理一些需要多模态输入的复杂逻辑,比如识别用户上传的草图并转成代码。
- 注意事项 Nano Banana 2 Lite 毕竟是个轻量模型,别指望它一次性写出完美的复杂架构。我的建议是让它写单一功能的模块,然后你自己拼装。
技巧三:用“去噪”思路评估 AI 写的自动化代码
-
适用场景 AI 帮你写完自动化脚本后,你怎么判断这代码到底靠不靠谱?
-
怎么做
- 参考 OpenAI 在 编程评估去噪 里提到的思路。
- 不要只看代码能不能跑通(这可能是噪音),要设计几个边缘测试用例(信号)。
- 让 AI 自己写单元测试,故意传入错误格式的数据,看它的异常处理逻辑是不是真的健壮。
- 注意事项 很多时候 AI 写的代码在理想路径下完美无缺,一遇到网络延迟或空数据就崩了。评估时一定要把“异常处理”作为核心指标。
小结
这波更新里,Gemini 3.5 Flash 的 computer use 确实让我眼前一亮,虽然还需要耐心调教 prompt,但已经能替代不少机械劳动了。如果你也想试试,建议先从最简单的网页点击开始。
分发工具