经济方案 · Qwen2.5-14B + Qwen3 系列(Q8/INT4) · 仅 deepseek-v4-pro 不私有化 · 更新时间:2026-08-19
| 序号 | 设备名称 | 数量 | 状态 | CPU | 内存 | GPU | 存储 | 部署组件 |
|---|---|---|---|---|---|---|---|---|
| 🖥 GPU 推理服务器(2 卡分载,10用户规模) | ||||||||
| 1 | GPU 服务器 LLM 卡 + VLM/Embed/Rerank 卡(分卡部署) |
1 | 新购 | 2×Intel Xeon 32核+ |
128 GB DDR4 ECC |
2×RTX 5090 32G Q8/INT4 方案 ~45G(含 KV) |
2 TB NVMe SSD |
Qwen2.5-14B Q8_0 ~16G(卡1) Qwen3-VL-8B Q8_0 ~12G(卡2) Qwen3-Embedding FP16 ~1.3G(卡2) Qwen3-Reranker-8B INT4 ~8G(卡2) Qwen2.5-VL-Embed FP16 ~8G(卡2) 总显存 ~45G · 卡1 ~16G / 卡2 ~29G |
| ⚙ 应用服务器 | ||||||||
| 2 | 应用服务器 业务服务 + 文档处理 + 网关 |
1 | 新购 | 2×Intel Xeon 32核+ |
128 GB DDR4 |
— 无需 GPU — | 1 TB SSD + 挂载 MinIO 卷 2TB+ |
bidding-tool (Python FastAPI) bidding-server (Java Spring Boot) MinerU 文档解析(CPU) PaddleOCR 纯CPU Nginx 反向代理 MySQL 8.0 业务数据库 Qdrant 向量数据库 MinIO 对象存储 Redis 7.x 缓存/限流 代码解释器 · DeepSearch TableRAG · NL2SQL |
| 🗄 数据库 & 中间件(合设至应用服务器,无需独立硬件) | ||||||||
| — | MySQL 8.0 关系型数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。存储用户信息、权限配置、知识库分类、文档元数据、接口调用日志等业务数据。 | MySQL 8.0 bidagent-dev 库 |
|||
| — | Qdrant 向量数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。管理文本向量、图片向量、页面向量三类集合,毫秒级 ANN 检索。 | Qdrant 端口 6333 |
|||
| — | MinIO 对象存储 |
1 | 新部署 | 与应用服务器共享 CPU/内存。数据盘 2TB+ 挂载至应用服务器。存储原始文档、PDF/图片素材、解析备份、模型权重备份等非结构化数据。 | MinIO S3 兼容 |
|||
| — | Redis 7.x 内存数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。缓存高频推理结果与热门问答、会话持久化、接口限流熔断。 | Redis 7.x | |||
| — | SQLite 嵌入式数据库 |
1 | 新部署 | 随 bidding-tool 进程启动,零配置。存储文件元数据(上传记录、解析状态、MinerU 任务映射)。 | SQLite | |||
| 模型 | 类型 | 部署方式 | 部署位置 | 显存 / 资源 | 推理框架 | 负责任务 |
|---|---|---|---|---|---|---|
| 🔒 私有化部署(文档数据不出内网) | ||||||
| Qwen2.5-14B-Instruct | LLM | llama.cpp · Q8_0 | GPU 服务器(卡1) | ~16 GB | llama.cpp | 文档分类 · 标签提取 · 证书识别 · 公司信息提取 · 知识问答 |
| Qwen3-VL-8B-Instruct | VLM | llama.cpp · Q8_0 | GPU 服务器(卡2) | ~12 GB | llama.cpp | 图片描述生成(Image Caption) |
| ★ PaddleOCR | OCR | 纯 CPU | 应用服务器 | 0(CPU) | PaddleOCR | 文档图片 · 扫描件文字提取(中文印刷体及表格印章场景) |
| Qwen3-Embedding-0.6B | Embed | vLLM · FP16 | GPU 服务器(卡2) | ~1.3 GB | vLLM | 文本向量化 · RAG 语义检索 |
| Qwen3-Reranker-8B | Rerank | vLLM · AWQ-INT4 | GPU 服务器(卡2) | ~8 GB | vLLM | 检索结果重排序 · 精准度优化 |
| Qwen2.5-VL-Embedding | ImgEmb | vLLM · FP16 | GPU 服务器(卡2) | ~8 GB | vLLM | 图片向量化 · 以图搜图 · 图片语义检索 |
| MinerU (开源版) | 解析 | 纯 CPU | 应用服务器 | 0(CPU) | MinerU | PDF/Word 结构化解析 · 正文/标题/图表/公式分离 |
| 私有化 GPU 显存合计 | ~45 GB | → 2×RTX 5090 32G 分卡装下(卡1 LLM ~16G / 卡2 视觉+向量 ~29G) | ||||
| 🌐 公网大模型 API(不触碰原始文档内容) | ||||||
| DeepSeek V4 Pro | LLM | 公有云 API | 公有云 | 0(本地) | — | 搜索增强 · 报告生成 · NL2SQL 查询 · 代码解释 · 查询拆解 · 搜索推理 |
| 对比维度 | 🥇 2×RTX 5090 32G | 🥈 1×RTX 4090 24G | 💸 1×A100-80G | 结论 |
|---|---|---|---|---|
| 显存 | 2×32 GB GDDR7(64G) | 24 GB GDDR6X | 80 GB HBM2e | ~45G 需求 → 双 5090 总余量 ~19G,单 4090 装不下 |
| 14B Q8_0 方案 | ✅ 分卡装下:卡1 LLM ~16G,卡2 视觉+向量 ~29G | ❌ 24G 单卡装不下全量(~45G) | ✅ 单卡全装 ~45G,余量 ~35G | 双 5090 分卡部署是黄金平衡点 |
| 分卡部署 | 卡1:Qwen2.5-14B;卡2:VL-8B + Emb/Rerank | — 无法承载全量 | 全部合并单卡 | 双卡需两个 vLLM 实例各绑一张卡 |
| ECC 内存 | ❌ 无 ECC | ❌ 无 ECC | ✅ 企业级 ECC | 知识库场景,文本提取纠错能力可弥补 |
| 7×24 稳定性 | ⚠️ 消费级,建议定期重启 | ⚠️ 同上 | ✅ 数据中心级 | 10用户非关键实时系统,可接受 |
| 功耗 | 2×575W = 1150W | 450W | 300W | 双 5090 功耗最高,需 1200W+ 电源与双 PCIe 插槽 |
| 采购价格 | ~¥7 万(2 张) | ~¥2 万 | ~¥12 万 | 双 5090 性价比仍最优 |
| 供货渠道 | 零售/渠道 | 已停产,二手为主 | 企业采购(代理商) | 5090 当前在产,渠道稳定 |
|
🥇 推荐 2×RTX 5090 32G(¥7万) —
Q8/INT4 方案合计 ~45G,卡1 LLM(~16G)+ 卡2 视觉/向量(~29G)分卡装下,总余量 ~19G。10用户性价比最优。 🥈 备选 1×A100-80G(¥12万) — 单卡全装余量 ~35G,企业级 ECC 更稳定,但价格与高性能方案重叠,预算充裕时考虑。 ❌ 1×RTX 4090 24G(¥2万)— 24G 单卡装不下全量模型(~45G),需多卡或更高显存。 |
||||
OCRBase 抽象接口接入,OCR_TYPE=paddle-ocr 一键切换,无需 GPU。