RAG(检索增强生成)
RAG(Retrieval-Augmented Generation)在生成前注入检索到的外部知识,缓解幻觉、提升时效性与可溯源性。本页综合本批次来源,聚焦中文/多模态 RAG 的评测方法论——数据集选型、分层指标、产品对比。
分层评测框架
RAG 评测必须分层,三层不可互相替代(四模态数据集选型指南):
| 层 | 指标 | 工具 |
|---|---|---|
| 检索层 | nDCG、Recall@k、MRR | DuReader_retrieval、T2Ranking、C-MTEB |
| 生成层 | faithfulness、context recall | RAGAS |
| 端到端层 | 答案正确性、引用支持度 | CRUD-RAG、FinRAGBench-V |
中文四模态数据集地图
| 模态 | 代表数据集 |
|---|---|
| 文档检索 | DuReader_retrieval、T2Ranking、C-MTEB |
| 结构化数据 | NL2SQL / TableQA 类 |
| 图像 | MUGE(多模态商品检索) |
| 视频 | VATEX、Video-MME |
| 领域专用 | FinRAGBench-V(金融多模态) |
| 端到端全链路 | CRUD-RAG(增删改查四类任务) |
选型方法论:先看许可证与可复现性,再看领域匹配与难度梯度;冻结数据集版本三元组保证可比。多模态(图/视频)是中文 RAG 的薄弱环节,数据集稀缺、标准未统一。
云端产品对比评测
八款云端 RAG/AI 搜索产品对比 的关键方法贡献:
- 黑盒 vs 可观测二分法:黑盒产品(商用 AI 搜索)只能端到端评测;可观测产品可分层定位失败在检索还是生成。
- 两档参数配置:默认配置测”开箱即用”,对齐配置测”调优上限”——避免用调优成绩冒充默认能力。
- 客观列最硬:hallucination rate(与引用源矛盾的事实占比)单独成列。
- 结论:可观测产品 faithfulness 更可控,黑盒产品体验更好但难审计;无全场景最优。
Query 数据集构建
中文 Query 评测数据集方案 强调评测 query 须贴近真实分布,避免纯合成 query 的分布偏移:用真实日志/拟真生成、按时效/多跳/查找复杂度分层、冻结版本三元组。是 RAG/搜索评测的上游基础。
矛盾或新想法
⚠️ 矛盾 [2026-07-25] 合成 query vs 真实 query 的方法论张力:CRUD-RAG 等合成基准易得、可控但有分布偏移(四模态指南);真实 query 贴近线上但采集/标注成本高且随时间漂移(Query 数据集方案)。两者需互补,不可偏废。
⚠️ 矛盾 [2026-07-25] 产品宣传常以”对齐参数后最优成绩”代表默认能力,存在系统性误导——评测须明确标注默认/对齐档位。