知识卡片2026-07-02·阅读 4 分钟
用 Gemini 3.5 Flash 接管鼠标键盘
告别机械点击,让 AI 替你操作电脑
Gemini 3.5 Flash 终于支持 Computer Use 了。我试了下用它自动化日常繁琐流程,结合端侧模型,效率直接翻倍。
背景
老实说,之前用各种 RPA 工具或者脚本写自动化,最烦的就是处理那些没有 API 的老旧内部系统。每次 UI 稍微改个按钮位置,脚本就全线崩溃。
最近看到 Google DeepMind 发布了 Gemini 3.5 Flash 引入 computer use 的消息,我第一时间去试了试。和传统的基于坐标或 DOM 树的自动化不同,它是真的在“看”屏幕并理解界面。再加上他们同期推出的 Nano Banana 2 Lite 和 Gemini Omni Flash,我觉得普通开发者和打工人的工作流要变天了。
技巧一:让 AI 替你完成跨系统的“搬砖”填表
- 适用场景 每天要把 CRM 里的客户数据,手动复制粘贴到公司那个连 API 都没有的老旧 ERP 系统里。
- 怎么做 以前你得写 Selenium 脚本,现在直接调用 Gemini 3.5 Flash 的 computer use 能力。你只需要给它一个自然语言指令:“打开 ERP 系统,登录后台,把这份 CSV 里的 50 个客户信息依次填入‘新建客户’表单,如果遇到必填项为空就跳过并记录日志。” 模型会自己截屏、识别输入框、模拟鼠标点击和键盘输入。就算 ERP 系统的弹窗位置变了,它也能自己看懂并关掉。
- 注意事项 别让它直接操作涉及资金转账的核心页面。初期跑的时候,最好把鼠标控制权留给它,但你在旁边盯着,随时准备物理打断。
技巧二:用 Nano Banana 2 Lite 搞定本地隐私数据的轻量处理
- 适用场景 需要在本地处理一些包含敏感信息的截图或文档,不想传到云端,但又需要多模态理解能力。
- 怎么做 利用 Nano Banana 2 Lite 这个轻量级模型。你可以把它部署在本地设备或者边缘节点上。 比如我写了一个本地小工具,让它实时读取我屏幕上的代码报错截图,直接在本地分析错误原因并生成修复建议。因为模型够小,推理速度极快,而且数据完全不出本机。
- 注意事项 轻量级模型在复杂逻辑推理上肯定不如大模型。如果它给出的代码修复方案看着有点离谱,记得切回云端大模型再验证一下。
技巧三:结合 Gemini Omni Flash 做实时语音+视觉的“结对编程”
- 适用场景 你在排查一个复杂的 UI 渲染 Bug,双手都在敲键盘,没空去打字描述问题。
- 怎么做 开启 Gemini Omni Flash 的多模态实时流。你可以直接对着麦克风说:“你看一下屏幕右下角那个下拉菜单,我点击后它没有展开,帮我看看控制台有没有报什么网络请求错误。” 模型不仅能“看”到你的屏幕画面,还能实时听你的语音,然后直接语音告诉你:“我看到控制台有个 403 错误,可能是你的 Token 过期了,去检查一下 Header。”这种边看边聊的体验,比以前干巴巴地复制日志强太多了。
- 注意事项 实时多模态交互对网络延迟有一定要求。如果网络不好,语音和画面的同步可能会有点割裂,建议在网络稳定的环境下使用。
小结
AI 正在从“对话框里的顾问”变成“能直接上手干活的同事”。无论是用 computer use 接管鼠标,还是用端侧模型保护隐私,核心都在于把那些“人觉得无聊但机器觉得简单”的活儿交出去。如果你还在手动写那些脆弱的 UI 自动化脚本,也许该换个思路了。
分发工具