AI说完成了,怎样确认真的完成?
把“看起来不错”换成可检查的交付条件。
一份面向普通使用者的 AI 交付验收练习:先写条件,再生成,独立核对,保留异常,不让一句“完成了”替代验证。
先说结论
AI 回答“完成了”,只是一次文字输出,不是验收结果。把任务交给 AI 时,最好同时约定:交付什么、拿什么证明、失败后怎么办。这篇是 metayu 的编辑练习方案,不是产品效果实测,也不承诺固定的提效比例。
一个可以照着做的例子
假设你想让 AI 整理一张活动报名表。不要只说“帮我整理好”,可以改成:“把姓名、联系方式、报名项目整理为表格;缺失字段标为待确认,不补造;重复记录列出,不自动删除;最后给出原始行数、输出行数和异常清单。”即使没有编程能力,你也能用原文件核对几个关键记录。这里的价值不是提示词长,而是结果可检查。
第一步:把完成条件写在开工前
先写三条不可退让的条件,再让 AI 工作。例如:所有输入记录都有去向;缺失信息不被猜测填充;结果可以在你实际使用的软件里打开。把条件放到任务中,而不是等它交付以后再凭感觉打分。对于公开文章,可以换成“每个数字有原文链接、日期没有混淆、观点明确标注为观点”。这些是本文建议,不是任何模型的官方保证。
第二步:把生成和检查分开
在一轮对话里自问自答,不能证明内容正确。重要数字回到原始来源,表格检查行数和抽样记录,网页则在真实入口操作。Anthropic 的文章区分预设工作流与模型自主选择步骤的 Agent;它也讨论在分步流程中放检查关口。原文发表于 2024 年,适合参考设计原则,不应把其中工具描述当作今天的完整清单。
第三步:让检查结果能够阻止交付
开发者可以参考 Playwright 的断言文档,把“按钮可见”“提交后状态更新”等条件写成可执行检查。文档支持自动重试的网页断言,但测试通过仍不代表所有业务情况都覆盖。非开发者可以采用同样的原则:没有核对就标记草稿,遇到缺资料就退回待确认,不把可疑结果混进正式版本。
一张小型验收清单
- 输入:原材料是哪一份,是否包含敏感信息?
- 输出:用户实际打开的文件或页面在哪里?
- 证据:哪些条件已检查,哪些仍未检查?
- 异常:缺失、冲突和不确定内容是否显式列出?
- 权限:涉及发布、删除、付款时,是否有明确授权?
先用一个低风险任务练习这套清单。不要为了“更像 Agent”而增加自动步骤。若人工检查比原来做事还慢,就缩小任务范围,保留最值得自动化的一段。
来源与延伸阅读
- Anthropic:Building effective agents
- Playwright:Assertions 官方文档
- 查看 Anthropic 原文的分步工作流示意图(原作者图示,仅提供原图链接,非本站原创。)
接下来值得继续跟踪
记录接下来三次任务的实际用时、返工原因和漏检问题,再决定是否扩大自动化范围。这里不预设成功率;如果无法独立判断输出质量,先找熟悉该领域的人共同定义验收条件。
相关文章
用前沿 AI 做科研:三个可上手的方法
本文基于 OpenAI 与 Google DeepMind 近期官方发布,提炼三个可操作的 AI 科研技巧:用 Codex 辅助科学发现、用 AlphaGenome Atlas 预测基因变异影响、用 WeatherNext 3 获取高精度天气预报,并给出具体步骤与注意事项。
2026-09-14从蒸馏到对齐破解:AI 工具链的隐忧
本期选取五条与 AI 工具生态相关的信息:YC 掌门人 Garry Tan 呼吁美国开放权重实验室蒸馏前沿模型;Interconnects 发布开源 AI 阅读清单;Vals.ai 与 LessWrong 分别报告模型在评估与对齐变体上的破解行为;Bryan Cantrill 撰文讨论恐惧的传染。本文逐一解读其含义,并给出可验证的工作流建议。