先定义评价对象
准确提取、正确分类、生成可用草稿与完成任务,是不同目标。为每类结果写出判断规则和负责人;主观任务可采用明确维度进行复核。数据来源、授权和脱敏也需要记录,不能为追求真实样本而忽略客户约定。
让失败类型有代表性
除了普通样本,加入缺失字段、冲突信息、异常格式和超出能力范围的输入。示例:系统应识别资料不足并请求补充,而不是用看似完整的回答掩盖缺失。测试比例需要依据实际业务,而非随机堆积大量容易通过的样本。
保留版本与变更结果
模型、提示、检索资料或流程变化后,用同一保留集比较,并查看退步集中在哪里。样本较少时展示数量和逐类结果,避免只报总体百分比。测试集也要更新,但应保留旧版本以解释质量变化。
行动清单
- 定义任务、评分口径、数据权限与复核人。
- 覆盖正常、困难、异常和需要拒答的输入。
- 保存模型与测试集版本,检查总体及分类型结果。