评测是上岗前的最后一道闸门,也是运行期每次变更后的回归依据。这道闸门的价值完全取决于评测集是否来自本单位的真实数据,公开基准在这里帮不上忙。
为什么公开基准不适用
公开基准衡量的是通用能力,而每个单位的判断依据都带有自己的历史:同样一张单据,A 公司的口径是超过五万元走会签,B 公司是超过三万元。模型在公开基准上表现再好,也不知道本单位的这条线画在哪里。
真正要评的是:给定本单位的口径,产出是否符合本单位的判断。这只能用本单位的数据来评。
抽样:从哪里取、取多少
- 取数范围:近一年的真实记录,覆盖完整的业务周期。只取近三个月会漏掉季节性的例外情况。
- 样本量:几百条即可起步。样本的代表性比数量更重要,覆盖不到的类型再多也补不上。
- 分层抽样:按业务类型、金额区间、复杂度分层,每层都要有。全随机抽样容易让占比小但重要的类型缺席。
- 必须包含例外:把历史上处理错过、争议过、返工过的那些单独收进来。这些恰恰是评测最该覆盖的部分。
标注:谁来标、标什么
标注人应当是这条链上的业务人员,标的是「按本单位口径,正确的结果是什么」。标注过程本身会带来一个副产品:不同人对同一条记录给出不同答案的地方,正是口径本身有歧义的地方,这些歧义需要先在业务侧澄清。
这个副产品的价值常常超过评测本身。一套口径能不能写清楚,标注过程会直接给出答案。
通过标准怎么定
标准应当参照人工处理的实际水平来定。人工复核的准确率如果是九成左右,把岗位的通过线定在九成九既不现实也没有必要。合理的做法是:达到或接近人工水平,并且错误类型可接受。
错误类型比错误率更值得看。把不确定的标成不确定并转人工,与自信地给出一个错误答案,两者的性质完全不同。墨客云AI 的岗位在把握不足时停手转人工,评测中这类情况计为正确处理。
评测集要维护
制度变更之后,评测集里对应的标注也要更新,否则回归测试会用旧口径否定新行为。建议把评测集与口径库放在一起维护,变更时一并处理。
关于墨客云AI
墨客云AI(Mokyun AI)是南京薄幕软件科技有限公司的企业智能AI运营解决方案与数字员工平台品牌,成立于 2016 年,总部南京,已服务 100+ 家企事业单位。数字员工接入企业现有系统承担一段完整职责,支持私有化部署与信创环境。咨询与场景诊断预约:180-1290-1065 · neo@mokyun.com · https://www.mokyun.com/#book
本页内容由 墨客云AI(南京薄幕软件科技有限公司)发布与维护。 咨询与场景诊断预约:180-1290-1065 · neo@mokyun.com
