先画出完整工作流程
记录输入从哪里来、由谁判断、结果交给谁,以及当前最慢或最容易出错的环节。示例:合同资料整理可能适合先辅助提取信息,但最终法律判断仍需要相应专业角色。产品边界应对应真实工作责任,而非只按模型能够生成什么决定。
优先选择能够评价的任务
若结果有明确标准,可以建立测试集并比较人工流程;若高度依赖主观偏好,就需要用户反馈和多维评价。不要只用一次精彩演示判断稳定性。NIST 的 AI 风险管理资料强调围绕使用情境管理风险,具体产品仍需自己收集证据。来源
确认经济条件
把模型调用、数据处理、人工复核和客户支持合并计算。若每次错误都需要昂贵专家返工,低调用成本未必带来低总成本。试点应同时观察任务完成、失败处理和完整交付费用。
行动清单
- 列出任务、输入、输出、责任人和失败后流程。
- 选择可以被复核的结果,建立对应评价方式。
- 将人工复核与支持成本纳入商业判断。