Dify 知识中枢

企业级 RAG 工程 · MCP Server 桥接 · 交付型智能客服

KNOWLEDGE HUB

核心目标

内部知识库

Goal 1

整合全公司历史代码、PRD、财务数据,形成企业级 RAG 知识库,供全员快速检索调用。

PDF DOCX 代码库

MCP Server

Goal 2

作为 MCP Server 供 Cursor、Claude Code、OpenClaw(10+ Agent)快速调用知识检索能力。

Cursor Claude Code OpenClaw

智能客服助手

Goal 3

通过交付型项目中的项目资料库,向客户提供智能客服助手与帮助中心两块内容。

智能客服 帮助中心

整体架构

数据接入层
RAG 中枢层
MCP 桥接层
多端调用

数据接入与清洗层

静态文件解析

PDF / DOCX / XLSX / PPTX 使用 Docling (IBM) 或 MarkItDown (微软) 解析,表格和复杂文档 Markdown 还原度极高。

Docling MarkItDown

历史文件转换

.doc / .xls 历史文件调用无头 LibreOffice 批量转存为 docx/xlsx,再进入解析流程。

LibreOffice 批量转换

API 文档解析

Swagger / XML / YML 解析为结构化 Markdown,保留接口路径、请求体、返回体,AI 理解能力更强。

OpenAPI Swagger

飞书云文档接入

定时任务(Cron)通过飞书开放平台 API 拉取云文档,导出为纯文本或 Markdown 同步至本地知识库。

飞书 API Cron 同步

RAG 核心中枢层

知识流转架构

知识入库

文档解析
分块策略

向量存储

bge-m3
embedding

语义检索

混合检索
Hybrid Search

重排序

reranker
精排模型

LLM 生成

Qwen2.5
本地推理

Dify.ai 内置完整 RAG 流水线:文档解析 → 文本分块 → 向量化 → 混合检索 → 重排序 → LLM 生成

文档解析

PDF / Word / Excel / PPT 多格式解析,保留表格结构和代码块

MarkItDown Docling

智能分块

语义分块策略,自动识别段落、标题、表格边界

语义分块 层级分块

混合检索

向量检索 + 关键词检索融合,兼顾语义理解和精确匹配

Vector BM25

LLM 生成

本地 Qwen2.5 大模型推理,隐私安全,延迟可控

Qwen2.5 本地部署

Dify.ai 部署方案

Docker Compose 一键部署

  • 自带数据清洗工作流、分块策略、向量模型接入
  • 混合检索(Hybrid Search)提升召回质量
  • 内置对话 UI 和知识库管理后台,开箱即用

能力矩阵

核心技术栈

bge-m3

embedding 向量模型

reranker

重排序精排模型

Qwen2.5

本地大模型推理

RabbitMQ

JSON 指令流转

MCP Server 桥接层

MCP 桥接原理

Python MCP SDK

1

使用官方 mcp Python SDK 快速起一个轻量级服务

2

定义 MCP Tool:search_enterprise_knowledge

3

Tool 调用时内部转发请求至 Dify RESTful API

4

获取检索结果,包装成 MCP 格式返回给大模型

已接入调用方

Model Context Protocol

Cursor

IDE 智能编码

Claude Code

AI 代码助手

OpenClaw

10+ Agent

未来将扩展更多 AI 工具接入知识库检索能力

交付型项目:客户接入方案

智能客服助手

Customer Service Bot

将 Dify 做好的"智能助理"发布为 WebApp 或嵌入代码(Iframe / Script),直接嵌入客户业务系统。

WebApp 发布 Iframe 嵌入 Script 接入

帮助中心

Help Center

基于项目资料库构建客户专属帮助中心,提供 FAQ 检索、操作指南、政策解读等自助服务。

FAQ 检索 操作指南 政策解读

示例:ETC 客服平台、跨域网关帮助中心 — 前端嵌入仅需 10 分钟

返回框架总览