Dify 知识中枢
企业级 RAG 工程 · MCP Server 桥接 · 交付型智能客服
核心目标
内部知识库
Goal 1
整合全公司历史代码、PRD、财务数据,形成企业级 RAG 知识库,供全员快速检索调用。
MCP Server
Goal 2
作为 MCP Server 供 Cursor、Claude Code、OpenClaw(10+ Agent)快速调用知识检索能力。
智能客服助手
Goal 3
通过交付型项目中的项目资料库,向客户提供智能客服助手与帮助中心两块内容。
整体架构
①数据接入与清洗层
静态文件解析
PDF / DOCX / XLSX / PPTX 使用 Docling (IBM) 或 MarkItDown (微软) 解析,表格和复杂文档 Markdown 还原度极高。
历史文件转换
.doc / .xls 历史文件调用无头 LibreOffice 批量转存为 docx/xlsx,再进入解析流程。
API 文档解析
Swagger / XML / YML 解析为结构化 Markdown,保留接口路径、请求体、返回体,AI 理解能力更强。
飞书云文档接入
定时任务(Cron)通过飞书开放平台 API 拉取云文档,导出为纯文本或 Markdown 同步至本地知识库。
②RAG 核心中枢层
知识流转架构
文档解析
分块策略
bge-m3
embedding
混合检索
Hybrid Search
reranker
精排模型
Qwen2.5
本地推理
Dify.ai 内置完整 RAG 流水线:文档解析 → 文本分块 → 向量化 → 混合检索 → 重排序 → LLM 生成
文档解析
PDF / Word / Excel / PPT 多格式解析,保留表格结构和代码块
智能分块
语义分块策略,自动识别段落、标题、表格边界
混合检索
向量检索 + 关键词检索融合,兼顾语义理解和精确匹配
LLM 生成
本地 Qwen2.5 大模型推理,隐私安全,延迟可控
Dify.ai 部署方案
Docker Compose 一键部署
- 自带数据清洗工作流、分块策略、向量模型接入
- 混合检索(Hybrid Search)提升召回质量
- 内置对话 UI 和知识库管理后台,开箱即用
能力矩阵
核心技术栈
bge-m3
embedding 向量模型
reranker
重排序精排模型
Qwen2.5
本地大模型推理
RabbitMQ
JSON 指令流转
③MCP Server 桥接层
MCP 桥接原理
Python MCP SDK
使用官方 mcp Python SDK 快速起一个轻量级服务
定义 MCP Tool:search_enterprise_knowledge
Tool 调用时内部转发请求至 Dify RESTful API
获取检索结果,包装成 MCP 格式返回给大模型
已接入调用方
Model Context Protocol
Cursor
IDE 智能编码
Claude Code
AI 代码助手
OpenClaw
10+ Agent
未来将扩展更多 AI 工具接入知识库检索能力
交付型项目:客户接入方案
智能客服助手
Customer Service Bot
将 Dify 做好的"智能助理"发布为 WebApp 或嵌入代码(Iframe / Script),直接嵌入客户业务系统。
帮助中心
Help Center
基于项目资料库构建客户专属帮助中心,提供 FAQ 检索、操作指南、政策解读等自助服务。
示例:ETC 客服平台、跨域网关帮助中心 — 前端嵌入仅需 10 分钟