PRODUCT 01 · 专业参考

RAG系统:让生成建立在可检索、可引用的知识证据上

RAG(检索增强生成)在回答或生成前,从外部知识源检索相关信息并将其提供给模型。企业级RAG的关键不是接上向量库,而是把知识治理、检索、引用、权限、评测与持续更新组成可验证系统。

知识治理混合检索证据引用持续评测
发布主体:绿色碳汇规划院(北京)有限公司专业复核依据:《GCPI行业AI操作平台产品与技术总体方案》V1.1发布:2026-08-10修订:2026-08-10

权威定义

RAG是什么,又不是什么

RAG把生成模型的参数化知识与外部可检索知识结合,使系统能够在任务发生时获取相关材料,再围绕材料生成结果。企业项目通常还需要加入关键词与字段检索、语义召回、重排、权限过滤、版本判断、引用定位和答案校验。

RAG不是事实保证器,也不自动解决资料错误、版本冲突、权限越界和专业责任问题。没有知识治理、真实问题集和持续运营的“上传文件+聊天”只是一种演示形态。

解决的业务问题与客户价值

查找困难

从政策、标准、制度、技术资料和项目文档中定位与问题真正相关的段落。

版本混乱

结合生效、废止、适用地域、组织和产品版本,减少引用失效材料。

依据不可见

让关键结论返回原始来源、条款、页码或可核验定位,而不是只给流畅文字。

知识更新慢

把发现、核验、发布、替代、撤回与回归评测纳入持续运营。

输入、处理与输出

  • 输入:文件、数据库记录、知识图谱、业务状态、查询条件和用户权限。
  • 处理:解析、去重、分段、元数据、全文/向量/结构化检索、重排、上下文组装和答案校验。
  • 输出:带来源的回答、文件比较、条款定位、依据清单、拒答或待核验状态。
授权资料与业务条件 → 解析和知识状态 → 权限与适用范围过滤 → 混合检索与重排 → 证据组装 → 生成与校验 → 引用、限制和下一步

适用与不适用

建议优先

适合

资料可授权使用、权威来源可识别、问题需要查证据、输出可由专业人员验证的场景。

先补条件

暂不适合

没有合法知识来源、资料质量失控、目标只是自由创作,或任务主要依赖实时交易与确定性计算。

不是RAG单独完成

需要组合

复杂研究需要Agent;业务动作需要连接器与审批;结构化计算应交给数据库、规则或程序。

实施阶段与主要交付物

  • 场景与语料基线:用户、问题集、来源、版权、版本、权限和非目标。
  • 知识工程:原件登记、解析质量、分类元数据、状态机、发布与撤回机制。
  • 检索链路:基线检索、混合召回、过滤、重排、引用定位和拒答策略。
  • 应用集成:身份、会话、业务上下文、反馈、日志、导出和必要系统接口。
  • 评测运营:黄金问题集、安全题、失败归因、回归门槛、更新责任和回滚。
  • 典型交付:知识目录、数据与答案契约、检索服务、应用界面/API、评测报告和运营手册。

怎么验收才不被演示效果误导

检索

证据是否被召回、排序是否合理,并单测强过滤、低频实体和版本冲突。

答案

是否正确、完整、相关,能否明确假设、缺失信息、不确定性与拒答。

引用

引用是否真实支持主张,能否定位原文、版本和适用范围。

安全

未发布、无权限、禁止模型使用或禁止导出的资料是否被全链路阻断。

效率

在客户确认的并发、响应、成本和可用性边界内完成真实问题。

业务

是否改善用户完成检索、比对、复核或材料准备任务的时间与质量。

常见失败与修正方向

  • 只做向量检索:补充精确、全文、字段和结构化查询,并用真实问题路由。
  • 切分参数一次定终身:保存版本,以黄金集比较后灰度切换和回滚。
  • 答案有链接但链接不支持结论:进行主张—证据一致性评测。
  • 权限只在页面隐藏:在检索、上下文、模型输入、展示和导出全链路执行。
  • 新旧制度同时回答:建立发布、替代、撤回和历史影响扫描。
  • 上线后无人负责:明确来源巡检、审核、问题修复和回归发布责任。

GCPI可以提供什么

绿色碳汇规划院提供场景诊断、知识与数据治理、企业级RAG架构、检索与引用链路、权限和答案契约、真实问题集评测、现有系统接入及持续运营。RAG可以独立作为知识服务,也可以作为Copilot、Agent、AI中台或AI OS的知识底座。

项目不统一承诺固定准确率、资料规模或实施周期;指标应由客户真实语料、问题风险、系统条件和验收范围共同确定。

FAQ

常见问题

先把关键边界说清楚,才能让AI建设进入真实业务。

有超长上下文模型,还需要RAG吗?

长上下文降低了部分切分与召回压力,但不替代来源治理、权限过滤、版本判断、引用定位、成本控制和持续更新。是否使用RAG应由真实语料与任务评测决定。

RAG能保证不产生幻觉吗?

不能绝对保证。应通过证据约束、结构化状态、引用校验、拒答、人工审核和持续评测降低风险,并把高风险判断交给确定性系统或专业人员。

什么时候不应只做RAG?

当任务需要多步骤调查、工具调用、结构化计算、审批或系统写入时,应组合Agent、规则程序、连接器和人工工作流。

REFERENCES · 参考来源

定义与治理依据

参考来源用于解释公开技术概念和治理原则;GCPI的具体产品边界、交付范围与项目事实仍以本网站明确口径及客户项目文件为准。

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksLewis 等,NeurIPS 2020 · 2020

    RAG原始研究论文,用于说明参数化模型与外部非参数知识结合的基本思想。

  2. Artificial Intelligence Risk Management Framework (AI RMF 1.0)NIST · 2023

    AI系统全生命周期可信与风险管理的公开框架。

START WITH A REAL PROBLEM

从一个可验证的业务场景开始

明确问题、资料、用户与验收指标,再决定知识、模型、智能体和系统怎么建设。