RAG 评测(RAG Benchmark)

围绕中文 RAG(检索增强生成)评测方法学与产品横向对比。


评测产品(八款)

  • 阿里云百炼
  • Tablestore RAG
  • ADB-RAG
  • OpenSearch
  • 火山引擎 Viking 知识库 / AI 搜索
  • 百度千帆知识库
  • Google Agent Search / Vertex AI Search

评测方法学

白盒 Group A:检索质量

  • recall@k
  • nDCG@10
  • MRR

黑盒 Group B:端到端生成

  • RAGAS faithfulness
  • answer correctness
  • context recall
  • 双向 pairwise LLM-as-Judge

中文四模态覆盖

  • 文档
  • 结构化数据
  • 图片
  • 视频

数据截止

  • 2026-06-26

相关 Wiki

[2026-07-17] OpenViking「上下文数据库」vs 传统 RAG(五维度对比)

  • OpenViking(github.com/volcengine/OpenViking,字节火山引擎开源,2.6 万星):不是又一 RAG 框架,而是「上下文数据库」——用文件系统范式统一管理 Agent 记忆、文档资源、技能(建目录、写文件、做检索)。
  • vs 传统 RAG 五维度对比
维度传统 RAGOpenViking
上下文组织碎片化(chunk 切分扁平)文件系统范式统一管理
Token 消耗暴力全量搜索烧 TokenL0/L1/L2 三层按需加载
检索效果语义 + top_k目录定位缩小范围再语义匹配
可调试性不知是 embedding/chunk/top_k 的锅检索轨迹可视化(看 Agent 先打开哪个目录、检索哪些文件)
记忆进化自动压缩会话、提取长期记忆
  • 2026-05 评测:在 User Memory、Agent Memory、知识库问答三场景效果都比传统方案好,同时 Token 消耗显著降低。L0/L1/L2 三层:L0 核心系统提示词每次加载、L1 当前任务按需加载、L2 历史记忆按需检索。v0.4.8(7-08)新增 GPU 加速(NVIDIA cuVS)、递归网页导入、记忆 v3(流式 + patch-merge)、Codex/Claude Code 插件。
  • 命名辨析(衔接本页既有”火山引擎 Viking 知识库”):本页”八款评测产品”中的”火山引擎 Viking 知识库 / AI 搜索”是商用 RAG 产品;本条 OpenViking 是开源上下文数据库(github.com/volcengine/OpenViking);另见 Viking-AI-Search(SearchCLI,AI 搜索 CLI)。三者同属火山引擎”Viking”品牌但独立——本页评测的是商用知识库,OpenViking 是开源项目。
  • 早期衔接:OpenViking 曾在 2026-03-24 源页出现(多仓库代码语义检索,代码检索 30% 错误率降至 0 + OpenClaw 记忆插件 2.0 后端),本次 7 月扩展为通用上下文数据库(v0.4.8、2.6 万星、GPU 加速),从”代码检索专用”扩展为通用上下文管理。

来源:../sources/2026-07-17-AI-Agent开源工具生态