metayu
知识卡片2026-06-29·阅读 5 分钟

用 AI Agent 接管繁琐电脑操作

别再手动搬运数据了,让 AI 直接帮你点鼠标。

Gemini 3.5 Flash 上线 Computer Use,AI 能直接操作界面了。结合 Agent 安全护栏,我总结了 3 个把繁琐工作甩给 AI 的实战技巧。

背景

老实说,过去两年我用 AI 最多的还是对话框模式。不管模型多聪明,它终究只能给我一段文本或代码,最后还得我自己去复制粘贴、切窗口、点鼠标。

但最近看到 Google DeepMind 给 Gemini 3.5 Flash 引入了 computer use,我感觉味道变了。AI 终于长出了手,能直接看懂屏幕并操作 UI 了。再结合 OpenAI 关于 Agent 改变工作方式的探讨,我觉得咱们普通打工人的工作流,是真的可以重构了。

技巧一:用 Computer Use 搞定跨系统数据搬运

  • 适用场景 每天要把 A 系统(比如某个老旧的网页后台)的数据,手动抄到 B 系统(比如公司的 CRM 或在线表格)里。这种活儿没技术含量,但极其耗时。

  • 怎么做 以前你得写 RPA 脚本,或者用 Python 爬取,遇到验证码或动态 UI 就抓瞎。现在你可以直接调用支持 computer use 的模型。

我试了一下这个思路:给 Agent 发送指令,让它打开浏览器,识别网页上的特定表格,逐行读取数据,然后切换到另一个标签页,自动填入表单并点击提交。

你可以尝试这样的 Prompt:请打开 [网址A],找到本月订单表格。把每一行的订单号和金额提取出来,然后切换到 [网址B] 的录入界面,逐条填入并点击保存。遇到弹窗就关闭。

  • 注意事项 屏幕操作有延迟,别指望它像本地脚本那样毫秒级响应。另外,第一次跑的时候最好在旁边盯着,防止它点错按钮。

技巧二:给自动化流程加上安全护栏

  • 适用场景 当你让 Agent 帮你处理一些敏感操作(比如自动回复客户邮件、审批小额报销)时,最怕它幻觉发作,乱发邮件或批错钱。

  • 怎么做 DeepMind 最近提到了 AI Agent 的安全控制路线图,核心是把传统 safeguards 和实时监控结合起来。这招我们在日常用 Agent 时完全能借鉴。

不要给 Agent 绝对的执行权。我的做法是设置一个 Human-in-the-loop 的拦截机制。比如,让 Agent 自动起草回复并填好表单,但在最后一步点击发送前,强制要求人工确认。

同时,在系统后台设置规则:如果 Agent 单次操作超过 5 次点击,或者涉及金额大于 500 元,直接触发警报并暂停任务。

  • 注意事项 安全护栏会增加流程的摩擦力。你需要自己权衡:哪些操作可以完全放权,哪些必须人工兜底。

技巧三:把 Agent 当数字员工而非搜索引擎

  • 适用场景 遇到复杂项目(比如策划一场活动或做一个新产品调研),习惯自己列大纲,然后让 AI 填空。

  • 怎么做 OpenAI 在讨论 Agent 如何改变工作时,强调了一个核心转变:从问答走向执行。

我现在的习惯是,直接把一个模糊的目标扔给 Agent,让它自己去拆解任务、调用工具。比如做竞品分析,我不再自己一个个去搜,而是让 Agent 自己去浏览指定的几个竞品网站,截图关键页面,汇总到一个文档里,最后给我输出一份对比报告。

你可以这样设定 Workflow:你的任务是分析 X、Y、Z 三个产品的定价策略。请依次访问它们的官网定价页,记录基础版和专业版的价格及核心差异,最后生成一个 Markdown 对比表格。

  • 注意事项 Agent 在长链路任务中容易迷失方向。建议把大任务拆成几个小里程碑,每完成一步让它汇报一次,你确认没问题再让它继续。

小结

AI 正在从大脑进化出手脚。Computer use 和更安全的 Agent 架构,意味着我们终于可以把那些机械的、跨系统的脏活累活甩出去了。别只盯着模型参数,多想想怎么让 AI 替你点鼠标吧。

分发工具

相关文章