metayu
知识卡片2026-07-02·阅读 4 分钟

用 Gemini 3.5 Flash 打造自动化工作流

结合 Computer Use 与多模态能力,构建从云端到端侧的完整 AI 自动化流水线。

分享 Gemini 3.5 Flash Computer Use 网页自动化、Omni Flash 多模态处理,及 Nano Banana 2 Lite 端侧部署的实战技巧。

背景

最近刷 Google DeepMind 的博客,我注意到他们更新了幾個新模型。最让我眼前一亮的是 Gemini 3.5 Flash 引入了 computer use 功能。老实说,之前用其他模型做 UI 自动化总是差点意思,这次看到官方直接支持,我马上跑去试了试。

同时,他们还发布了 Nano Banana 2 Lite 和 Gemini Omni Flash。如果你和我一样,平时喜欢折腾一些自动化脚本或者端侧小应用,这三个模型组合起来刚好能覆盖从云端多模态处理到端侧轻量推理,再到直接接管鼠标键盘的完整链路。

今天就来聊聊,怎么把这几个新特性用到实际工作流里。

技巧一:用 Gemini 3.5 Flash 的 Computer Use 搞定网页自动化

  • 适用场景 需要跨多个老旧后台系统搬运数据,或者每天要定时在网页上点来点去填表的场景。传统写 Selenium 脚本太脆弱,DOM 一变就挂。

  • 怎么做

    1. 去 DeepMind 开发者后台开通 Gemini 3.5 Flash 的 API 权限。
    2. 在你的自动化脚本里,把当前屏幕截图或浏览器 DOM 树传给模型。
    3. 给模型下达自然语言指令,比如“找到本月的报表并点击下载”。
    4. 解析模型返回的 computer use 动作(如点击坐标、输入文本),用 PyAutoGUI 或类似库执行。
  • 注意事项 别让它直接操作你的主力银行账户或核心生产环境。初期测试时,我建议在虚拟机或者 Docker 容器里跑,万一它点错了也不至于搞崩系统。

技巧二:用 Gemini Omni Flash 处理复杂多模态输入

  • 适用场景 你的工作流里不仅有文本,还有会议录音、产品演示视频或者复杂的图表。以前得用好几个模型拼凑,现在想一步到位。

  • 怎么做

    1. 将音视频文件或实时流接入 Gemini Omni Flash 的端点。
    2. 设定好 system prompt,让它直接输出结构化的 JSON 摘要或关键帧标记。
    3. 把提取出的结构化数据,直接喂给下游的数据库或触发器。
  • 注意事项 Omni 模型处理长视频时 token 消耗可能比较大。我试过直接扔一个两小时的视频进去,账单有点心疼。建议先用 FFmpeg 把视频抽帧或切片,只把关键片段喂给它。

技巧三:用 Nano Banana 2 Lite 做端侧离线兜底

  • 适用场景 网络不稳定,或者对数据隐私要求极高,不能把数据传到云端的边缘设备(比如本地工控机、智能终端)。

  • 怎么做

    1. 下载 Nano Banana 2 Lite 的模型权重。
    2. 用 ONNX 或 TensorRT 等工具做一下量化和格式转换,塞进你的边缘设备。
    3. 在本地写个简单的推理服务,处理一些基础的意图识别或数据清洗。
    4. 当遇到本地模型搞不定的复杂逻辑时,再 fallback 到云端的 Gemini 3.5 Flash。
  • 注意事项 带 "Lite" 后缀意味着它在参数量上做了妥协。别指望它能写出完美的复杂代码,把它当成一个快速的“前哨”过滤器用,效果反而最好。

小结

这波更新确实给了开发者更多选择。Gemini 3.5 Flash 的 computer use 解决了“最后一公里”的 UI 操作问题,Omni Flash 补齐了多模态,而 Nano Banana 2 Lite 则让端侧部署变得更轻量。如果你手头刚好有卡脖子的自动化需求,不妨拿它们练练手。

分发工具

相关文章

用 Gemini 3.5 Flash 打造自动化工作流 · metayu insight