RAG(检索增强生成)

RAG(Retrieval-Augmented Generation)在生成前注入检索到的外部知识,缓解幻觉、提升时效性与可溯源性。本页综合本批次来源,聚焦中文/多模态 RAG 的评测方法论——数据集选型、分层指标、产品对比。


分层评测框架

RAG 评测必须分层,三层不可互相替代(四模态数据集选型指南):

指标工具
检索层nDCG、Recall@k、MRRDuReader_retrieval、T2Ranking、C-MTEB
生成层faithfulness、context recallRAGAS
端到端层答案正确性、引用支持度CRUD-RAG、FinRAGBench-V

中文四模态数据集地图

模态代表数据集
文档检索DuReader_retrieval、T2Ranking、C-MTEB
结构化数据NL2SQL / TableQA 类
图像MUGE(多模态商品检索)
视频VATEX、Video-MME
领域专用FinRAGBench-V(金融多模态)
端到端全链路CRUD-RAG(增删改查四类任务)

选型方法论:先看许可证与可复现性,再看领域匹配与难度梯度;冻结数据集版本三元组保证可比。多模态(图/视频)是中文 RAG 的薄弱环节,数据集稀缺、标准未统一。


云端产品对比评测

八款云端 RAG/AI 搜索产品对比 的关键方法贡献:

  • 黑盒 vs 可观测二分法:黑盒产品(商用 AI 搜索)只能端到端评测;可观测产品可分层定位失败在检索还是生成。
  • 两档参数配置:默认配置测”开箱即用”,对齐配置测”调优上限”——避免用调优成绩冒充默认能力。
  • 客观列最硬:hallucination rate(与引用源矛盾的事实占比)单独成列。
  • 结论:可观测产品 faithfulness 更可控,黑盒产品体验更好但难审计;无全场景最优。

Query 数据集构建

中文 Query 评测数据集方案 强调评测 query 须贴近真实分布,避免纯合成 query 的分布偏移:用真实日志/拟真生成、按时效/多跳/查找复杂度分层、冻结版本三元组。是 RAG/搜索评测的上游基础。


矛盾或新想法

⚠️ 矛盾 [2026-07-25] 合成 query vs 真实 query 的方法论张力:CRUD-RAG 等合成基准易得、可控但有分布偏移(四模态指南);真实 query 贴近线上但采集/标注成本高且随时间漂移(Query 数据集方案)。两者需互补,不可偏废。

⚠️ 矛盾 [2026-07-25] 产品宣传常以”对齐参数后最优成绩”代表默认能力,存在系统性误导——评测须明确标注默认/对齐档位。