metayu
知识卡片2026-09-13·阅读 4 分钟

AI说完成了,怎样确认真的完成?

把“看起来不错”换成可检查的交付条件。

一份面向普通使用者的 AI 交付验收练习:先写条件,再生成,独立核对,保留异常,不让一句“完成了”替代验证。

先说结论

AI 回答“完成了”,只是一次文字输出,不是验收结果。把任务交给 AI 时,最好同时约定:交付什么、拿什么证明、失败后怎么办。这篇是 metayu 的编辑练习方案,不是产品效果实测,也不承诺固定的提效比例。

一个可以照着做的例子

假设你想让 AI 整理一张活动报名表。不要只说“帮我整理好”,可以改成:“把姓名、联系方式、报名项目整理为表格;缺失字段标为待确认,不补造;重复记录列出,不自动删除;最后给出原始行数、输出行数和异常清单。”即使没有编程能力,你也能用原文件核对几个关键记录。这里的价值不是提示词长,而是结果可检查。

第一步:把完成条件写在开工前

先写三条不可退让的条件,再让 AI 工作。例如:所有输入记录都有去向;缺失信息不被猜测填充;结果可以在你实际使用的软件里打开。把条件放到任务中,而不是等它交付以后再凭感觉打分。对于公开文章,可以换成“每个数字有原文链接、日期没有混淆、观点明确标注为观点”。这些是本文建议,不是任何模型的官方保证。

第二步:把生成和检查分开

在一轮对话里自问自答,不能证明内容正确。重要数字回到原始来源,表格检查行数和抽样记录,网页则在真实入口操作。Anthropic 的文章区分预设工作流与模型自主选择步骤的 Agent;它也讨论在分步流程中放检查关口。原文发表于 2024 年,适合参考设计原则,不应把其中工具描述当作今天的完整清单。

第三步:让检查结果能够阻止交付

开发者可以参考 Playwright 的断言文档,把“按钮可见”“提交后状态更新”等条件写成可执行检查。文档支持自动重试的网页断言,但测试通过仍不代表所有业务情况都覆盖。非开发者可以采用同样的原则:没有核对就标记草稿,遇到缺资料就退回待确认,不把可疑结果混进正式版本。

一张小型验收清单

  • 输入:原材料是哪一份,是否包含敏感信息?
  • 输出:用户实际打开的文件或页面在哪里?
  • 证据:哪些条件已检查,哪些仍未检查?
  • 异常:缺失、冲突和不确定内容是否显式列出?
  • 权限:涉及发布、删除、付款时,是否有明确授权?

先用一个低风险任务练习这套清单。不要为了“更像 Agent”而增加自动步骤。若人工检查比原来做事还慢,就缩小任务范围,保留最值得自动化的一段。

来源与延伸阅读

接下来值得继续跟踪

记录接下来三次任务的实际用时、返工原因和漏检问题,再决定是否扩大自动化范围。这里不预设成功率;如果无法独立判断输出质量,先找熟悉该领域的人共同定义验收条件。

分发工具

相关文章