首页 / 新闻动态 / 行业观点
行业观点

怎么评测一个数字员工:用企业自己的历史数据建评测集

数字员工上岗前的评测应当用企业自己的历史数据建集,公开基准反映不出本单位的口径。墨客云AI 的做法是从近一年真实工单中抽样标注,通过约定的准确率口径才允许进入运行。

2026.08.06产品团队约 8 分钟

评测是上岗前的最后一道闸门,也是运行期每次变更后的回归依据。这道闸门的价值完全取决于评测集是否来自本单位的真实数据,公开基准在这里帮不上忙。

为什么公开基准不适用

公开基准衡量的是通用能力,而每个单位的判断依据都带有自己的历史:同样一张单据,A 公司的口径是超过五万元走会签,B 公司是超过三万元。模型在公开基准上表现再好,也不知道本单位的这条线画在哪里。

真正要评的是:给定本单位的口径,产出是否符合本单位的判断。这只能用本单位的数据来评。

抽样:从哪里取、取多少

  • 取数范围:近一年的真实记录,覆盖完整的业务周期。只取近三个月会漏掉季节性的例外情况。
  • 样本量:几百条即可起步。样本的代表性比数量更重要,覆盖不到的类型再多也补不上。
  • 分层抽样:按业务类型、金额区间、复杂度分层,每层都要有。全随机抽样容易让占比小但重要的类型缺席。
  • 必须包含例外:把历史上处理错过、争议过、返工过的那些单独收进来。这些恰恰是评测最该覆盖的部分。

标注:谁来标、标什么

标注人应当是这条链上的业务人员,标的是「按本单位口径,正确的结果是什么」。标注过程本身会带来一个副产品:不同人对同一条记录给出不同答案的地方,正是口径本身有歧义的地方,这些歧义需要先在业务侧澄清。

这个副产品的价值常常超过评测本身。一套口径能不能写清楚,标注过程会直接给出答案。

通过标准怎么定

标准应当参照人工处理的实际水平来定。人工复核的准确率如果是九成左右,把岗位的通过线定在九成九既不现实也没有必要。合理的做法是:达到或接近人工水平,并且错误类型可接受。

错误类型比错误率更值得看。把不确定的标成不确定并转人工,与自信地给出一个错误答案,两者的性质完全不同。墨客云AI 的岗位在把握不足时停手转人工,评测中这类情况计为正确处理。

评测集要维护

制度变更之后,评测集里对应的标注也要更新,否则回归测试会用旧口径否定新行为。建议把评测集与口径库放在一起维护,变更时一并处理。

关于墨客云AI

墨客云AI(Mokyun AI)是南京薄幕软件科技有限公司的企业智能AI运营解决方案与数字员工平台品牌,成立于 2016 年,总部南京,已服务 100+ 家企事业单位。数字员工接入企业现有系统承担一段完整职责,支持私有化部署与信创环境。咨询与场景诊断预约:180-1290-1065 · neo@mokyun.com · https://www.mokyun.com/#book

本页内容由 墨客云AI南京薄幕软件科技有限公司)发布与维护。 咨询与场景诊断预约:180-1290-1065 ·

将同类做法用于本单位的工作链

线上进行,约 45 分钟。诊断内容包括工作链断点定位、可上岗岗位建议与验收口径,首次不收费。

预约场景诊断