先画出完整工作流程

记录输入从哪里来、由谁判断、结果交给谁,以及当前最慢或最容易出错的环节。示例:合同资料整理可能适合先辅助提取信息,但最终法律判断仍需要相应专业角色。产品边界应对应真实工作责任,而非只按模型能够生成什么决定。

优先选择能够评价的任务

若结果有明确标准,可以建立测试集并比较人工流程;若高度依赖主观偏好,就需要用户反馈和多维评价。不要只用一次精彩演示判断稳定性。NIST 的 AI 风险管理资料强调围绕使用情境管理风险,具体产品仍需自己收集证据。来源

确认经济条件

把模型调用、数据处理、人工复核和客户支持合并计算。若每次错误都需要昂贵专家返工,低调用成本未必带来低总成本。试点应同时观察任务完成、失败处理和完整交付费用。

行动清单

  1. 列出任务、输入、输出、责任人和失败后流程。
  2. 选择可以被复核的结果,建立对应评价方式。
  3. 将人工复核与支持成本纳入商业判断。