RAGAS是什么与选型
上一篇收束了自建指标的全部四组——意图、检索、性能、行为,覆盖了路由对不对、文档找到没、用户等多久、系统行为合不合理。这四组指标有一个共同特点:全是集合运算或数值运算,跑一遍不到 1 秒,可以挂 CI 每次提交都跑。
但它们也有一个共同的盲区——评不了内容。
假设某条 query 的自建指标全绿:Hit@5 = 1.0,Recall@5 = 1.0,intent_top1 正确,TTFT 也在阈值内。打开实际回答一看:模型在 chunk 信息的基础上多编了一段话。chunk 里只写了保修 1 年,模型回答保修 1 年且 AppleCare+ 可延保至 3 年——后半句是编的。自建指标对这种幻觉完全无感。检索确实命中了正确文档,意图确实分对了,响应确实够快——但答案是错的。
这就是需要 RAGAS 的理由。