Bid 智能招投标系统 — 私有化部署架构(14B 经济方案)

经济方案 · Qwen2.5-14B + Qwen3 系列(Q8/INT4) · 仅 deepseek-v4-pro 不私有化 · 更新时间:2026-08-19

👥 10 用户规模 — 经济配置
2
服务器GPU + 应用(合设)
2
GPU 卡 RTX 5090 32G(分卡部署)
7
私有化模型/组件
5
基础设施服务MySQL/Qdrant/Redis/MinIO/Nginx
1
保留公有云 API

📋 设备清单— 共 2 台服务器 · 全新项目实施

序号 设备名称 数量 状态 CPU 内存 GPU 存储 部署组件
🖥 GPU 推理服务器(2 卡分载,10用户规模)
1 GPU 服务器
LLM 卡 + VLM/Embed/Rerank 卡(分卡部署)
1 新购 2×Intel Xeon
32核+
128 GB
DDR4 ECC
2×RTX 5090 32G
Q8/INT4 方案 ~45G(含 KV)
2 TB NVMe SSD Qwen2.5-14B Q8_0 ~16G(卡1)
Qwen3-VL-8B Q8_0 ~12G(卡2)
Qwen3-Embedding FP16 ~1.3G(卡2)
Qwen3-Reranker-8B INT4 ~8G(卡2)
Qwen2.5-VL-Embed FP16 ~8G(卡2)
总显存 ~45G · 卡1 ~16G / 卡2 ~29G
⚙ 应用服务器
2 应用服务器
业务服务 + 文档处理 + 网关
1 新购 2×Intel Xeon
32核+
128 GB
DDR4
— 无需 GPU — 1 TB SSD
+ 挂载 MinIO 卷 2TB+
bidding-tool (Python FastAPI)
bidding-server (Java Spring Boot)
MinerU 文档解析(CPU)
PaddleOCR 纯CPU
Nginx 反向代理
MySQL 8.0 业务数据库
Qdrant 向量数据库
MinIO 对象存储
Redis 7.x 缓存/限流
代码解释器 · DeepSearch
TableRAG · NL2SQL
🗄 数据库 & 中间件(合设至应用服务器,无需独立硬件)
MySQL 8.0
关系型数据库
1 新部署 与应用服务器共享 CPU/内存。存储用户信息、权限配置、知识库分类、文档元数据、接口调用日志等业务数据。 MySQL 8.0
bidagent-dev 库
Qdrant
向量数据库
1 新部署 与应用服务器共享 CPU/内存。管理文本向量、图片向量、页面向量三类集合,毫秒级 ANN 检索。 Qdrant
端口 6333
MinIO
对象存储
1 新部署 与应用服务器共享 CPU/内存。数据盘 2TB+ 挂载至应用服务器。存储原始文档、PDF/图片素材、解析备份、模型权重备份等非结构化数据。 MinIO
S3 兼容
Redis 7.x
内存数据库
1 新部署 与应用服务器共享 CPU/内存。缓存高频推理结果与热门问答、会话持久化、接口限流熔断。 Redis 7.x
SQLite
嵌入式数据库
1 新部署 随 bidding-tool 进程启动,零配置。存储文件元数据(上传记录、解析状态、MinerU 任务映射)。 SQLite

🧠 模型部署明细— 生产环境 · 私有化 + 公网双轨方案

双轨策略: 触碰原始文档内容的任务 → 私有化 Qwen2.5-14B(文档不出发内网)  |   搜索增强 · 报告生成 · NL2SQL · 代码执行等不触碰文档原文的任务 → 公网 DeepSeek V4 Pro(兼顾推理性能与成本)
模型 类型 部署方式 部署位置 显存 / 资源 推理框架 负责任务
🔒 私有化部署(文档数据不出内网)
Qwen2.5-14B-Instruct LLM llama.cpp · Q8_0 GPU 服务器(卡1) ~16 GB llama.cpp 文档分类 · 标签提取 · 证书识别 · 公司信息提取 · 知识问答
Qwen3-VL-8B-Instruct VLM llama.cpp · Q8_0 GPU 服务器(卡2) ~12 GB llama.cpp 图片描述生成(Image Caption)
★ PaddleOCR OCR 纯 CPU 应用服务器 0(CPU) PaddleOCR 文档图片 · 扫描件文字提取(中文印刷体及表格印章场景)
Qwen3-Embedding-0.6B Embed vLLM · FP16 GPU 服务器(卡2) ~1.3 GB vLLM 文本向量化 · RAG 语义检索
Qwen3-Reranker-8B Rerank vLLM · AWQ-INT4 GPU 服务器(卡2) ~8 GB vLLM 检索结果重排序 · 精准度优化
Qwen2.5-VL-Embedding ImgEmb vLLM · FP16 GPU 服务器(卡2) ~8 GB vLLM 图片向量化 · 以图搜图 · 图片语义检索
MinerU (开源版) 解析 纯 CPU 应用服务器 0(CPU) MinerU PDF/Word 结构化解析 · 正文/标题/图表/公式分离
私有化 GPU 显存合计 ~45 GB → 2×RTX 5090 32G 分卡装下(卡1 LLM ~16G / 卡2 视觉+向量 ~29G)
🌐 公网大模型 API(不触碰原始文档内容)
DeepSeek V4 Pro LLM 公有云 API 公有云 0(本地) 搜索增强 · 报告生成 · NL2SQL 查询 · 代码解释 · 查询拆解 · 搜索推理

🎮 GPU 选型对比— Q8/INT4 全系需 ~45G 显存

对比维度 🥇 2×RTX 5090 32G 🥈 1×RTX 4090 24G 💸 1×A100-80G 结论
显存 2×32 GB GDDR7(64G) 24 GB GDDR6X 80 GB HBM2e ~45G 需求 → 双 5090 总余量 ~19G,单 4090 装不下
14B Q8_0 方案 ✅ 分卡装下:卡1 LLM ~16G,卡2 视觉+向量 ~29G ❌ 24G 单卡装不下全量(~45G) ✅ 单卡全装 ~45G,余量 ~35G 双 5090 分卡部署是黄金平衡点
分卡部署 卡1:Qwen2.5-14B;卡2:VL-8B + Emb/Rerank — 无法承载全量 全部合并单卡 双卡需两个 vLLM 实例各绑一张卡
ECC 内存 ❌ 无 ECC ❌ 无 ECC ✅ 企业级 ECC 知识库场景,文本提取纠错能力可弥补
7×24 稳定性 ⚠️ 消费级,建议定期重启 ⚠️ 同上 ✅ 数据中心级 10用户非关键实时系统,可接受
功耗 2×575W = 1150W 450W 300W 双 5090 功耗最高,需 1200W+ 电源与双 PCIe 插槽
采购价格 ~¥7 万(2 张) ~¥2 万 ~¥12 万 双 5090 性价比仍最优
供货渠道 零售/渠道 已停产,二手为主 企业采购(代理商) 5090 当前在产,渠道稳定
🥇 推荐 2×RTX 5090 32G(¥7万) — Q8/INT4 方案合计 ~45G,卡1 LLM(~16G)+ 卡2 视觉/向量(~29G)分卡装下,总余量 ~19G。10用户性价比最优。
🥈 备选 1×A100-80G(¥12万) — 单卡全装余量 ~35G,企业级 ECC 更稳定,但价格与高性能方案重叠,预算充裕时考虑。
1×RTX 4090 24G(¥2万)— 24G 单卡装不下全量模型(~45G),需多卡或更高显存。
Bid 智能招投标系统 — 私有化部署架构(PaddleOCR 方案 · 10用户规模) ☁ 公有云 API(仅1个) DeepSeek V4 Pro LLM · 搜索 · 报告 · NL2SQL · 代码解释 DashScope VLM/Embedding/Rerank → 已迁至私有GPU 🖥 GPU 推理服务器(合并部署) LLM + VLM(Q8_0 · 分卡) 卡1 Qwen2.5-14B (~16G) 卡2 VL-8B (~12G) 文档分类/标签/证书提取 + 图片描述 Embedding + Reranker Qwen3-Emb Qwen3-Rerank VL-Embed 显存合计 ~45G · 2×RTX 5090 分卡 · 见 GPU 选型对比 👥 10用户规模:Q8/INT4 · LLM 与 VLM 分卡部署 ⚙ 应用服务器(含网关+存储) 🤖 bidding-tool (Python FastAPI) ☕ bidding-server (Java Spring Boot) 📄 MinerU 文档解析 (CPU) 🔍 PaddleOCR 纯 CPU 代码解释器 DeepSearch TableRAG/NL2SQL 🔀 Nginx 网关 MinIO + Redis 推荐配置: 32核64G · 1TB SSD · Nginx/MinIO/Redis 合设 💾 数据存储层 🗄 MySQL 8.0 关系型数据库 · 业务数据 🔍 Qdrant 向量数据库 · ANN 检索 🗃 SQLite / Elasticsearch 文件元数据 / 全文检索 MySQL / Qdrant / MinIO / Redis 全部合设至应用服务器 👤 用户端 🌐 DeepSeek V4 Pro API(唯一不私有化) 搜索增强 · 报告生成 · NL2SQL · 不触碰原始文档 外部API(不触碰文档数据) HTTPS LLM/VLM Emb/Rerank 本地 图例 公有云 API(不私有化) GPU 推理(合并部署) 应用 + 网关 + 存储(合设) 数据库 & 中间件(合设) CPU 组件(无需 GPU) 外部 API 调用 资源统计(10用户规模) 需采购服务器 1-2 台 GPU 卡 2×RTX 5090 显存总量 ~45 GB 仅 deepseek-v4-pro 不私有化 1 个 10用户精简策略 1. 🏆 Qwen2.5-14B + Qwen3 系列 2. Q8/INT4 ~45G → 2×RTX 5090 ¥7万 3. MinIO/Redis/Nginx合设至应用服务器 4. PaddleOCR纯CPU,零GPU占用 模型迁移映射:云端 API → 私有化部署(10用户 · Q8/INT4 方案) 功能 当前 (云端 API) 私有化? 私有化方案(Q8/INT4) 显存 部署位置 大语言模型 deepseek-v4-pro (API) ❌ 例外 保留 API + 私有 Qwen2.5-14B Q8 ~16G GPU服务器 · llama.cpp(卡1) 视觉语言模型 qwen3-vl-plus (DashScope) Qwen3-VL-8B Q8(仅Caption) ~12G GPU服务器 · llama.cpp(卡2) OCR 文字识别 vlm-ocr (DashScope VLM) ★ PaddleOCR 纯CPU 0 应用服务器 · 本地进程 文本向量嵌入 text-embedding-v4 (DashScope) Qwen3-Embedding-0.6B (vLLM) ~1.3G GPU服务器 · vLLM 重排序模型 qwen3-rerank (DashScope) Qwen3-Reranker-8B (vLLM·INT4) ~8G GPU服务器 · vLLM 多模态图片嵌入 qwen2.5-vl-embed (DashScope) Qwen2.5-VL-Embedding ~8G GPU服务器 · vLLM 文档解析 mineru.net 云端API MinerU 开源版(CPU) 0 应用服务器
10用户规模私有化部署架构:GPU服务器 2×RTX 5090 分卡部署全部推理模型(Q8/INT4,显存合计~45GB), 应用服务器合设Nginx网关+MinIO+Redis。全系采用 Qwen2.5-14B + Qwen3 系列,仅deepseek-v4-pro保留公有云API。
备注:
  1. 10 用户并发极低(预估同时 1-3 个文档处理请求)。LLM/VLM 采用 Q8_0、重排 AWQ-INT4,显存占用低、双 5090 轻松承载;并发增长至 50+ 时可换 1×A100-80G 合并部署。
  2. GPU 推荐:2×RTX 5090 32G 分卡部署(卡1 跑 Qwen2.5-14B Q8 ~16G,卡2 跑 VL-8B+向量/重排 ~29G,¥7万)。卡2 余量较紧(29G/32G),若需更大并发余量可评估 1×RTX 6000 Ada 48G 单卡全装;单卡 4090 24G 装不下全量(~45G)。
  3. 应用服务器合设:Nginx、MinIO、Redis 均合设至应用服务器,10 用户场景无需独立硬件。MinIO 数据盘建议 2TB 起。
  4. 文档数据安全:文档分类/标签/证书提取等触碰原始文档的任务走私有 Qwen2.5-14B,不走 DeepSeek API。
  5. PaddleOCR 通过 OCRBase 抽象接口接入,OCR_TYPE=paddle-ocr 一键切换,无需 GPU。