测评数据初始化
上一篇讲了评估集的 schema——150 条样本,12 个字段,每个字段为什么存在、被谁消费。评估集设计好了,但 Ragent 还是空的。
评估集里标了 S1-01 应该召回 GUIDE_PHONE_002,但如果 Ragent 的知识库里压根没有这篇文档,评测就是空转——检索指标算出来全是 0,不是系统差,是根本没东西可检索。意图树也一样,评估集标了 S1_选购推荐,但 Ragent 没建这个意图节点,意图识别就无从谈起。
这篇讲的是评测的基建:怎么用三个 Python 脚本把 Ragent 从空白状态搭到可评测状态——有知识库、有文档、有意图树。