RAG 评测(RAG Benchmark)
围绕中文 RAG(检索增强生成)评测方法学与产品横向对比。
评测产品(八款)
- 阿里云百炼
- Tablestore RAG
- ADB-RAG
- OpenSearch
- 火山引擎 Viking 知识库 / AI 搜索
- 百度千帆知识库
- Google Agent Search / Vertex AI Search
评测方法学
白盒 Group A:检索质量
- recall@k
- nDCG@10
- MRR
黑盒 Group B:端到端生成
- RAGAS faithfulness
- answer correctness
- context recall
- 双向 pairwise LLM-as-Judge
中文四模态覆盖
- 文档
- 结构化数据
- 图片
- 视频
数据截止
- 2026-06-26
相关 Wiki
[2026-07-17] OpenViking「上下文数据库」vs 传统 RAG(五维度对比)
- OpenViking(github.com/volcengine/OpenViking,字节火山引擎开源,2.6 万星):不是又一 RAG 框架,而是「上下文数据库」——用文件系统范式统一管理 Agent 记忆、文档资源、技能(建目录、写文件、做检索)。
- vs 传统 RAG 五维度对比:
| 维度 | 传统 RAG | OpenViking |
|---|---|---|
| 上下文组织 | 碎片化(chunk 切分扁平) | 文件系统范式统一管理 |
| Token 消耗 | 暴力全量搜索烧 Token | L0/L1/L2 三层按需加载 |
| 检索效果 | 语义 + top_k | 目录定位缩小范围再语义匹配 |
| 可调试性 | 不知是 embedding/chunk/top_k 的锅 | 检索轨迹可视化(看 Agent 先打开哪个目录、检索哪些文件) |
| 记忆进化 | 无 | 自动压缩会话、提取长期记忆 |
- 2026-05 评测:在 User Memory、Agent Memory、知识库问答三场景效果都比传统方案好,同时 Token 消耗显著降低。L0/L1/L2 三层:L0 核心系统提示词每次加载、L1 当前任务按需加载、L2 历史记忆按需检索。v0.4.8(7-08)新增 GPU 加速(NVIDIA cuVS)、递归网页导入、记忆 v3(流式 + patch-merge)、Codex/Claude Code 插件。
- 命名辨析(衔接本页既有”火山引擎 Viking 知识库”):本页”八款评测产品”中的”火山引擎 Viking 知识库 / AI 搜索”是商用 RAG 产品;本条 OpenViking 是开源上下文数据库(github.com/volcengine/OpenViking);另见 Viking-AI-Search(SearchCLI,AI 搜索 CLI)。三者同属火山引擎”Viking”品牌但独立——本页评测的是商用知识库,OpenViking 是开源项目。
- 早期衔接:OpenViking 曾在 2026-03-24 源页出现(多仓库代码语义检索,代码检索 30% 错误率降至 0 + OpenClaw 记忆插件 2.0 后端),本次 7 月扩展为通用上下文数据库(v0.4.8、2.6 万星、GPU 加速),从”代码检索专用”扩展为通用上下文管理。