INSIGHT 03

如何评价一个RAG项目是否可用?

不要只看演示时能否答出几个问题。可用的RAG需要在真实问题集上持续验证检索、答案、引用、安全、效率和业务效果。

证据召回答案准确引用一致业务效果
发布主体:绿色碳汇规划院(北京)有限公司专业复核依据:《GCPI行业AI操作平台产品与技术总体方案》V1.1发布:2026-07-29修订:2026-08-10

六类评测指标

检索

需要的证据是否进入候选结果,排序是否合理。

答案

结论是否正确、完整、与问题相关,并明确不确定性。

引用

引用是否真的支持结论,能否定位到原文和版本。

安全

权限隔离、敏感信息保护、提示注入和越权是否受控。

效率

响应时间、成本、并发与系统稳定性是否满足场景。

任务

用户完成工作所需时间、返工率和质量是否改善。

评测问题从哪里来

优先收集真实用户过去提出的问题、专家常见判断任务、容易混淆的条款、跨文件问题、版本问题和应当拒答的问题。测试集需要覆盖简单检索、综合分析、缺失信息和高风险边界。

上线不是评测终点

知识、政策、用户问题和模型都会变化。系统需要记录失败案例、分析检索与生成原因、补充知识和规则,并周期性回归评测。持续运营能力往往比一次性的模型选择更重要。

START WITH A REAL PROBLEM

从一个可验证的业务场景开始

明确问题、资料、用户与验收指标,再决定知识、模型、智能体和系统怎么建设。