知识卡片2026-07-04·阅读 5 分钟
让 AI 替你点鼠标:3个实操工作流
别再只让 AI 陪聊了,用最新模型接管你的重复劳动和端侧任务。
Gemini 3.5 Flash 引入 computer use,让 AI 直接操作电脑。结合端侧多模态模型与普及经验,提供 3 个立刻能用的 AI 效率工作流。
背景
最近看了一圈各大厂的更新,老实说,有些功能真的让我眼前一亮。特别是 Google DeepMind 在 Gemini 3.5 Flash 里上了 computer use(计算机操作)能力,这意味着 AI 终于不只是“陪你聊天”,而是能直接“替你干活”了。结合 ChatGPT 采用率的持续扩张,我觉得现在的核心已经不是“要不要用 AI”,而是“怎么让 AI 真正接管那些烦人的重复劳动”。我试了几个新特性,整理了 3 个马上就能用起来的实战技巧。
技巧一:用 Gemini 3.5 Flash 接管繁琐的网页操作
- 适用场景:每天要在各种后台系统里填表、跨系统搬运数据、或者做定期的网页巡检。
- 怎么做:以前搞自动化,大家习惯用 RPA 写脚本调接口。但这玩意太脆弱了,网页 UI 稍微改个按钮位置,脚本直接罢工。现在有了 computer use,思路完全变了。你直接扔给它一个高层指令,比如“登录后台,把昨天的退款订单导出来填进共享表格”。它会自己用“眼睛”看屏幕,识别输入框、点下拉菜单,像个真人在操作。
- 注意事项:别一开始就让它做涉及资金支付的最终确认。先让它在测试环境跑,或者把最后一步“点击提交”改成“截图让我确认”。
技巧二:用 Nano Banana 2 Lite 搞定低延迟的端侧多模态
- 适用场景:需要处理实时视频流、本地隐私图片,或者网络环境不稳定的现场巡检、仓库盘点。
- 怎么做:如果你受够了把高清图片传到云端再等 API 返回的龟速,Nano Banana 2 Lite 和 Gemini Omni Flash 这俩模型搭配起来绝对是个惊喜。它们特别适合做轻量级的本地部署。想象一下仓库盘点场景:直接用本地摄像头拍货架,模型在端侧瞬间识别出哪里缺货。不用把视频流全传上云,带宽省了,数据隐私也保住了。
- 注意事项:端侧模型的参数量毕竟有限,别指望它能做复杂的长文本逻辑推理。把它当成一个“眼睛”和“快嘴”,复杂的决策还是交给云端大模型。
技巧三:抄作业 ChatGPT 的普及路线,搞定团队 AI 落地
- 适用场景:你是团队里的“AI 布道者”,但同事们总是觉得“学起来太麻烦”或者“这玩意对我没用”。
- 怎么做:我看过 OpenAI 关于 ChatGPT 采用率扩展 的官方复盘,发现一个很管用的套路:别给团队推“通用大模型”,去推“特定场景的微型工作流”。别跟财务说“你可以用 AI 写邮件”,直接给他们一个配好 prompt 的快捷指令:“上传发票 PDF,自动提取金额生成报销单”。把门槛降到最低。如果是生物医疗等垂直行业,还可以借鉴 GeneBench Pro 这种专业基准的思路,给团队找专门针对你们行业的微调工具,而不是硬塞通用模型。
- 注意事项:千万别搞全员强制培训。找两三个痛点最深的同事,帮他们把效率提上去,其他人自然会来问你“你最近怎么下班这么早”。
小结
AI 工具现在卷的不是参数大小,而是谁能更深地嵌进我们的工作流里。无论是让模型直接操作电脑,还是在端侧跑多模态,核心都在于把“人”从机械劳动里解放出来。如果你还没试过让 AI 替你点鼠标,强烈建议今天就去搞个测试环境跑一下,那种感觉真的回不去了。
分发工具