INSIGHT 03
如何评价一个RAG项目是否可用?
不要只看演示时能否答出几个问题。可用的RAG需要在真实问题集上持续验证检索、答案、引用、安全、效率和业务效果。
证据召回答案准确引用一致业务效果
六类评测指标
检索
需要的证据是否进入候选结果,排序是否合理。
答案
结论是否正确、完整、与问题相关,并明确不确定性。
引用
引用是否真的支持结论,能否定位到原文和版本。
安全
权限隔离、敏感信息保护、提示注入和越权是否受控。
效率
响应时间、成本、并发与系统稳定性是否满足场景。
任务
用户完成工作所需时间、返工率和质量是否改善。
评测问题从哪里来
优先收集真实用户过去提出的问题、专家常见判断任务、容易混淆的条款、跨文件问题、版本问题和应当拒答的问题。测试集需要覆盖简单检索、综合分析、缺失信息和高风险边界。
上线不是评测终点
知识、政策、用户问题和模型都会变化。系统需要记录失败案例、分析检索与生成原因、补充知识和规则,并周期性回归评测。持续运营能力往往比一次性的模型选择更重要。
