metayu
知识卡片2026-07-06·阅读 5 分钟

用 Gemini 3.5 接管鼠标与本地部署实战

手把手教你用最新 AI 模型搞定电脑自动化与端侧部署。

最近 DeepMind 发了几个好玩的新模型。我试了下 Gemini 3.5 Flash 的电脑操作功能,还有端侧的 Nano Banana 2 Lite。这篇文章分享三个我跑通的实战工作流,帮你把重复劳动交给 AI。

背景

老实说,每天在几个软件之间切来切去复制粘贴,真的挺烦人的。前阵子看到 Google DeepMind 发布了 Gemini 3.5 Flash 的 Computer Use 功能,还有主打轻量的 Nano Banana 2 Lite,我马上跑去申请了测试。

用了几天感觉,现在的 AI 已经不只是“聊天机器人”了,它真的能帮你“点鼠标”。如果你和我一样,想把那些无聊的跨应用操作自动化,或者想在本地跑个不联网的隐私助手,这篇实战笔记应该能帮到你。

技巧一:让 Gemini 3.5 Flash 帮你点鼠标填表

  • 适用场景 每天要登录后台系统导出数据,或者在多个网页之间搬运信息。传统方式得自己写 Python 爬虫或者用 RPA 工具,调试 XPath 能让人头秃。

  • 怎么做 我现在的 workflow 是直接给 Gemini 3.5 Flash 下达自然语言指令。

  1. 在支持 Computer Use 的 API 或测试环境中,开启屏幕共享权限。
  2. 输入提示词:“帮我打开浏览器,登录 XX 后台,把今天的销售报表导出来,并重命名为‘0707_data.csv’保存到桌面。”
  3. 模型会自己截屏、识别按钮位置、模拟点击和键盘输入。 对比传统 RPA,你不需要写死坐标,哪怕网页改版了按钮位置变了,它也能靠视觉识别找到。
  • 注意事项 这玩意儿有时候会“点错”。我建议在关键操作(比如付款、删除)前,在 prompt 里加一句“在执行最后一步前暂停并向我确认”。另外,屏幕分辨率最好固定,不然它识别 UI 元素可能会飘。

技巧二:用 Nano Banana 2 Lite 搞定断网环境下的文档处理

  • 适用场景 公司要求代码或财务数据绝对不能上传到云端,但你又急需 AI 帮你做代码审查或数据清洗。

  • 怎么做 Nano Banana 2 Lite 这种轻量级模型就是为端侧准备的。

  1. 去官方渠道下载模型权重,用 Ollama 或类似的本地推理框架加载。
  2. 写个简单的 Python 脚本,把本地文件夹里的敏感文档读取出来,喂给本地 API。
  3. 让它在本地生成摘要或检查代码漏洞。 因为完全在本地跑,断网也能用。我试了一下,处理几十页的 PDF 速度比我想象的快,虽然逻辑推理不如大模型,但做信息提取完全够用了。
  • 注意事项 显存是个硬门槛。如果你的电脑只有 8G 显存,记得在加载时开启量化(比如 4-bit),不然直接 OOM 报错。别指望它能写复杂的架构代码,把它当成一个不知疲倦的文本处理小工就好。

技巧三:用 Omni Flash 处理“乱七八糟”的多模态输入

  • 适用场景 老板扔给你一段会议录音、几张白板照片,让你整理成项目需求文档。以前你得自己听录音、看图猜字。

  • 怎么做 这次一起发布的 Gemini Omni Flash 处理混合输入很拿手。

  1. 把音频文件和图片打包,通过 API 传给 Omni Flash。
  2. Prompt 这样写:“听这段录音,结合图片里的架构图,提取出下一步的 Action Items,并标明责任人。”
  3. 它能把语音里的口语化表达和图片里的视觉信息对齐,直接输出结构化的 Markdown。
  • 注意事项 多模态模型的 token 消耗比较大。如果音频太长,建议先用传统工具转成文字,再把文字和图片一起喂给它,这样能省不少 API 费用。

小结

现在的 AI 工具早就过了“只能问答”的阶段。不管是让 Gemini 3.5 Flash 帮你操作电脑,还是用 Nano Banana 2 Lite 保护隐私,核心都在于把它们嵌入你现有的工作流里。别光看着,挑一个最痛的场景,今天就去试一下。

分发工具

相关文章