高性能方案 · Qwen2.5-14B + Qwen3 系列(Q8/INT4) · 仅 deepseek-v4-pro 不私有化 · 更新时间:2026-08-19
| 序号 | 设备名称 | 数量 | 状态 | CPU | 内存 | GPU | 存储 | 部署组件 |
|---|---|---|---|---|---|---|---|---|
| 🖥 GPU 推理服务器(2 卡分载,10用户规模) | ||||||||
| 1 | GPU 服务器 LLM 卡 + VLM/Embed/Rerank 卡(分卡部署) |
1 | 新购 | 2×Intel Xeon 32核+ |
256 GB DDR4 ECC |
2×A100-80G Q8/INT4 方案 ~45G(含 KV) |
2 TB NVMe SSD |
Qwen2.5-14B Q8_0 ~16G(卡1) Qwen3-VL-8B Q8_0 ~12G(卡2) Qwen3-Embedding FP16 ~1.3G(卡2) Qwen3-Reranker-8B INT4 ~8G(卡2) Qwen2.5-VL-Embed FP16 ~8G(卡2) 总显存 ~45G · 卡1 ~16G / 卡2 ~29G |
| ⚙ 应用服务器 | ||||||||
| 2 | 应用服务器 业务服务 + 文档处理 + 网关 |
1 | 新购 | 2×Intel Xeon 32核+ |
256 GB DDR4 |
— 无需 GPU — | 2 TB SSD + 挂载 MinIO 卷 4TB+ |
bidding-tool (Python FastAPI) bidding-server (Java Spring Boot) MinerU 文档解析(CPU) PaddleOCR 纯CPU Nginx 反向代理 MySQL 8.0 业务数据库 Qdrant 向量数据库 MinIO 对象存储 Redis 7.x 缓存/限流 代码解释器 · DeepSearch TableRAG · NL2SQL |
| 🗄 数据库 & 中间件(合设至应用服务器,无需独立硬件) | ||||||||
| — | MySQL 8.0 关系型数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。存储用户信息、权限配置、知识库分类、文档元数据、接口调用日志等业务数据。 | MySQL 8.0 bidagent-dev 库 |
|||
| — | Qdrant 向量数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。管理文本向量、图片向量、页面向量三类集合,毫秒级 ANN 检索。 | Qdrant 端口 6333 |
|||
| — | MinIO 对象存储 |
1 | 新部署 | 与应用服务器共享 CPU/内存。数据盘 2TB+ 挂载至应用服务器。存储原始文档、PDF/图片素材、解析备份、模型权重备份等非结构化数据。 | MinIO S3 兼容 |
|||
| — | Redis 7.x 内存数据库 |
1 | 新部署 | 与应用服务器共享 CPU/内存。缓存高频推理结果与热门问答、会话持久化、接口限流熔断。 | Redis 7.x | |||
| — | SQLite 嵌入式数据库 |
1 | 新部署 | 随 bidding-tool 进程启动,零配置。存储文件元数据(上传记录、解析状态、MinerU 任务映射)。 | SQLite | |||
| 模型 | 类型 | 部署方式 | 部署位置 | 显存 / 资源 | 推理框架 | 负责任务 |
|---|---|---|---|---|---|---|
| 🔒 私有化部署(文档数据不出内网) | ||||||
| Qwen2.5-14B-Instruct | LLM | llama.cpp · Q8_0 | GPU 服务器(卡1) | ~16 GB | llama.cpp | 文档分类 · 标签提取 · 证书识别 · 公司信息提取 · 知识问答 |
| Qwen3-VL-8B-Instruct | VLM | llama.cpp · Q8_0 | GPU 服务器(卡2) | ~12 GB | llama.cpp | 图片描述生成(Image Caption) |
| ★ PaddleOCR | OCR | 纯 CPU | 应用服务器 | 0(CPU) | PaddleOCR | 文档图片 · 扫描件文字提取(中文印刷体及表格印章场景) |
| Qwen3-Embedding-0.6B | Embed | vLLM · FP16 | GPU 服务器(卡2) | ~1.3 GB | vLLM | 文本向量化 · RAG 语义检索 |
| Qwen3-Reranker-8B | Rerank | vLLM · AWQ-INT4 | GPU 服务器(卡2) | ~8 GB | vLLM | 检索结果重排序 · 精准度优化 |
| Qwen2.5-VL-Embedding | ImgEmb | vLLM · FP16 | GPU 服务器(卡2) | ~8 GB | vLLM | 图片向量化 · 以图搜图 · 图片语义检索 |
| MinerU (开源版) | 解析 | 纯 CPU | 应用服务器 | 0(CPU) | MinerU | PDF/Word 结构化解析 · 正文/标题/图表/公式分离 |
| 私有化 GPU 显存合计 | ~45 GB | → 2×A100-80G 分卡装下(卡1 LLM ~16G / 卡2 视觉+向量 ~29G) | ||||
| 🌐 公网大模型 API(不触碰原始文档内容) | ||||||
| DeepSeek V4 Pro | LLM | 公有云 API | 公有云 | 0(本地) | — | 搜索增强 · 报告生成 · NL2SQL 查询 · 代码解释 · 查询拆解 · 搜索推理 |
| 对比维度 | 🥇 2×A100-80G | 🥈 1×A100-80G | 💸 2×RTX 5090 32G | 结论 |
|---|---|---|---|---|
| 显存 | 2×80 GB HBM2e(160G) | 80 GB HBM2e | 64 GB GDDR7(32G×2) | ~45G 需求 → 双 A100 余量 ~115G,单 A100(~35G 余量)/ 双 5090(~19G 余量)均可装下 |
| 14B Q8_0 方案 | ✅ 分卡装下:卡1 LLM ~16G,卡2 视觉+向量 ~29G | ✅ 单卡全装 ~45G,余量 ~35G | ✅ 64G 装下 ~45G,余量 ~19G | 双 A100 侧重企业级冗余与未来扩展 |
| 分卡部署 | 卡1:Qwen2.5-14B;卡2:VL-8B + Emb/Rerank | 单卡可全装,或分卡 | 分卡/单卡均可,无需张量并行 | 双卡需两个 vLLM 实例各绑一张卡 |
| ECC 内存 | ✅ 企业级 ECC | ✅ 企业级 ECC | ❌ 无 ECC | 企业级 ECC 降低推理静默错误风险,长期 7×24 稳定 |
| 7×24 稳定性 | ✅ 数据中心级,7×24 无忧 | ✅ 数据中心级,7×24 无忧 | ⚠️ 消费级,建议定期重启 | A100 适合长期连续运行 |
| 单卡 vs 多卡 | ⚠️ 双卡分实例部署(LLM / VLM 各一卡) | ✅ 单卡省心(~45G 轻松装下) | ✅ 单卡/分卡均可行 | 双 A100 分卡比张量并行简单 |
| 功耗 | 2×300W = 600W | 300W | 2×575W = 1150W | 双 A100 功耗仅双 5090 一半 |
| 采购价格 | ~¥24 万(2 张) | ~¥12 万 | ~¥7 万 | 双 A100 最贵,贵在企业级 ECC 与冗余而非算力需求 |
| 供货渠道 | 企业采购(代理商) | 企业采购(代理商) | 零售/渠道 | A100 需走企业采购流程 |
|
🥇 推荐 2×A100-80G(¥24万) —
Q8/INT4 方案合计 ~45G,卡1 LLM(~16G)+ 卡2 视觉/向量(~29G)分卡装下,总余量 ~115G。ECC + 数据中心级,为未来升级更大模型 / 更高并发预留巨大空间。 🥈 1×A100-80G(¥12万)单卡全装 ~45G 余量 ~35G — 10 用户绰绰有余;若未来模型升级至 35B+ 或并发大幅增长,需再加卡。 ❌ 2×RTX 5090 32G(¥7万)— 性价比最高,但消费级无 ECC、长期 7×24 稳定性弱于 A100。 |
||||
OCRBase 抽象接口接入,OCR_TYPE=paddle-ocr 一键切换,无需 GPU。