RAG系统怎么进行评测?
作者:程序员马丁
note
Ragent AI —— 从 0 到 1 纯手工打造企业级 Agentic RAG,拒绝 Demo 玩具!AI 时代,助你拿个offer。
开篇引言
前面 18 篇,咱们一步步把 RAG 链路跑通了——从分块、向量化、检索策略到生成策略,从 Function Call、MCP 到会话记忆、Query 改写、意图识别,最后还讲了评估与优化的基本思路。到这里,一套 RAG 系统已经能跑起来、能回答用户问题了。
Ragent 的测评项目地址 ragenteval,放在了咱们星球内部的代码仓库,如果之前申请过牛券、oneThread 等项目,无需重复申请。如果还没有申请过,请参考 内部项目权限申请流程 进行申请,审核开放后即可查看。
但跑通只是起点。
你改了一行 system prompt,检索效果到底是变好还是变差?你换了 embedding 模型,答案质量有没有提升?你加了 rerank,有没有引入回归?这些问题,靠抽几条 case 看看效果是回答不了的。
评测系列就是来解决这个问题的。前 18 篇回答的是问答链路怎么跑通,接下来这 11 篇回答一个完全不同的问题——跑通之后,怎么证明它跑得好?
之前的并发项目,比如 12306、牛券这些,如何让面试官感觉是有亮点的?重点考量的是项目的并发、数据以及架构设计,对于现在的 AI 智能体项目,更多是测评、真实业务场景得出来的指标。