rendered paste body我现在有七张4090,ubuntu系统,我想要部署开源的本地大模型,纯GPU使用。主要功能包括三点:1.文档翻译,包括常用格式和Ocr;2.俄语转文字;3.多个文档的内容综合分析,检索,总结可以。按每张 4090 为 24GB 计算,7 张卡足够部署一套实用的本地“文档翻译 + 俄语转写 + 多文档知识库”系统。我建议采用专用模型分工,不要把 7 张卡全部绑成一个超大模型。推荐显卡分配GPU 服务 推荐模型 用途0–1 综合分析模型 Qwen3.5-35B-A3B-FP8 多文档分析、归纳、问答,开启思考模式2–3 翻译模型 同一模型的第二实例 文档翻译,关闭思考模式,提高速度4 文档解析/OCR PaddleOCR-VL-1.6 + PP-StructureV3 扫描件、PDF、表格、公式、版面识别5 俄语语音识别 Qwen3-ASR-1.7B + ForcedAligner-0.6B 俄语转写、语言识别、时间戳6 检索模型 Qwen3-Embedding-4B + Qwen3-Reranker-0.6B 向量化、跨语言检索、结果重排Qwen3.5-35B-A3B 总参数 35B、每次仅激活约 3B,官方 FP8 权重约 38GB,两张 4090 可以承载一个实例;模型支持 201 种语言、262K 原生上下文,官方称 FP8 与原模型指标接近。Qwen3.5 官方模型卡4090 属于 Ada 架构,vLLM 原生支持 FP8 W8A8,因此这里选 FP8 比 INT4 更适合你的硬件。vLLM FP8 支持说明三项功能的具体实现1. 文档翻译与 OCR处理流程: 原生 PDF 先提取文字层。 扫描 PDF、图片、TIFF 使用 PaddleOCR。 识别标题、段落、表格、公式、图片及阅读顺序。 按段落和表格单元翻译,不按固定字符数切割。 使用术语库和翻译记忆库保证同一术语前后一致。 检查数字、日期、单位、专有名词、表格行列是否改变。 重建 DOCX、PDF 或双语对照文档。PaddleOCR-VL 支持 109 种语言,PP-StructureV3 可以输出带版面信息的 Markdown/JSON;PP-DocTranslation 本身就是复杂版面文档翻译管线,可将翻译后端换成本地 Qwen 接口。PaddleOCR、PP-DocTranslation常用格式建议这样处理:格式 处理方式DOCX 直接修改 OOXML 文本节点,尽量保留样式PPTX 翻译文本框、表格和备注,保留坐标XLSX 逐单元格翻译,保护公式和数字PDF 提取文字层;扫描件走 OCRPNG/JPG/TIFF OCR 后重建 DOCX/PDFHTML/MD/TXT 直接解析和翻译需要注意:PDF 的中俄文长度差异很大,“像素级保持原版式”不能百分百保证。实际生产中最好同时输出“尽量保持版式版本”和“双语 DOCX 版本”。2. 俄语转文字优先使用 Qwen3-ASR-1.7B,而不是 Whisper。它明确支持俄语、长音频、流式和离线推理;搭配 Qwen3-ForcedAligner 可以生成俄语词级时间戳。Qwen3-ASR 官方模型卡流程建议: FFmpeg 统一转成 16kHz 单声道; Qwen3-ASR 生成原始俄语文本; ForcedAligner 添加句子/词级时间戳; 主模型只负责标点修复、分段和专有名词纠错; 同时保留“原始转写”和“清洗后文本”,防止大模型改写原意。如果是多人会议,还需要再增加说话人分离模型。3. 多文档检索、总结与综合分析推荐使用: Qwen3-Embedding-4B:生成中英俄跨语言向量; Qdrant:保存向量、原文、文档名、页码和章节; Qdrant BM25:精确关键词检索; Qwen3-Reranker-0.6B:对候选内容二次排序; Qwen3.5:根据检索内容生成带出处的结论。Qwen3 Embedding/Reranker 支持 100 多种语言和最长 32K 输入。Qwen3 Embedding 官方说明Qdrant 可以在一次查询中融合语义向量和 BM25 关键词结果。Qdrant 混合检索建议检索参数: 按标题、段落和表格切块,每块约 500–1000 token; 语义检索与 BM25 各取 30–50 条; 融合后用 Reranker 重排; 最终给主模型 8–15 条证据; 每个结论必须带“文档名、页码、章节”; 全库总结采用“逐文档总结 → 主题合并 → 总体归纳”,不要把所有全文一次塞进上下文。服务架构建议全部用 Docker 隔离: vLLM:两个 Qwen3.5 服务; PaddleOCR:OCR/版面服务; Qwen-ASR:语音服务; Embedding/Reranker:检索模型服务; Qdrant:向量和 BM25; PostgreSQL:用户、任务、文档元数据; MinIO:原始文件和结果文件; Redis + Celery:长任务队列; FastAPI:统一接口; Open WebUI 或自建前端:上传、翻译、转写和知识库问答。主模型可以先这样启动:CUDA_VISIBLE_DEVICES=0,1 vllm serve Qwen/Qwen3.5-35B-A3B-FP8 \ --tensor-parallel-size 2 \ --max-model-len 131072 \ --gpu-memory-utilization 0.92 \ --language-model-only \ --reasoning-parser qwen3 \ --port 8001翻译实例使用 GPU 2、3,建议先限制为 64K 上下文,并在请求中传入:{ "chat_template_kwargs": { "enable_thinking": false }}4090 没有 NVLink。初次部署可先用兼容性较好的 TP=2;稳定后再测试 PP=2。vLLM 官方指出,无 NVLink 的机器有时流水线并行通信开销更低。vLLM 多卡部署说明“纯 GPU”需要说明可以做到所有神经网络推理都在 GPU 上、不做 CPU offload,但下面这些仍然由 CPU 完成: PDF/DOCX/PPTX 解包; 音频解码; 文档重建; Qdrant/PostgreSQL; 队列调度和网络服务。因此不建议使用 KTransformers 或 llama.cpp 的 CPU-GPU 混合卸载。机器最好有: 256GB 内存,最低建议 128GB; 2–4TB NVMe; 32 核以上 CPU; 足够的 PCIe 通道; 4kW 左右供电和散热能力。下一步如果要我直接给出可运行的 docker-compose.yml、GPU 绑定、目录结构和 FastAPI 接口,需要你补充:Ubuntu 版本、CPU/内存/NVMe、主要翻译语言对、并发人数,以及是否必须保持原文件格式。