All pastes #6MKVVQjsYJ Raw Edit

text paste

public text v1 · immutable
#6MKVVQjsYJ ·published 2026-08-03 05:18 UTC
rendered paste body
我现在有七张4090,ubuntu系统,我想要部署开源的本地大模型,纯GPU使用。主要功能包括三点:1.文档翻译,包括常用格式和Ocr;2.俄语转文字;3.多个文档的内容综合分析,检索,总结可以。按每张 4090 为 24GB 计算,7 张卡足够部署一套实用的本地“文档翻译 + 俄语转写 + 多文档知识库”系统。我建议采用专用模型分工,不要把 7 张卡全部绑成一个超大模型。推荐显卡分配GPU	服务	推荐模型	用途0–1	综合分析模型	Qwen3.5-35B-A3B-FP8	多文档分析、归纳、问答,开启思考模式2–3	翻译模型	同一模型的第二实例	文档翻译,关闭思考模式,提高速度4	文档解析/OCR	PaddleOCR-VL-1.6 + PP-StructureV3	扫描件、PDF、表格、公式、版面识别5	俄语语音识别	Qwen3-ASR-1.7B + ForcedAligner-0.6B	俄语转写、语言识别、时间戳6	检索模型	Qwen3-Embedding-4B + Qwen3-Reranker-0.6B	向量化、跨语言检索、结果重排Qwen3.5-35B-A3B 总参数 35B、每次仅激活约 3B,官方 FP8 权重约 38GB,两张 4090 可以承载一个实例;模型支持 201 种语言、262K 原生上下文,官方称 FP8 与原模型指标接近。Qwen3.5 官方模型卡4090 属于 Ada 架构,vLLM 原生支持 FP8 W8A8,因此这里选 FP8 比 INT4 更适合你的硬件。vLLM FP8 支持说明三项功能的具体实现1. 文档翻译与 OCR处理流程:    原生 PDF 先提取文字层。    扫描 PDF、图片、TIFF 使用 PaddleOCR。    识别标题、段落、表格、公式、图片及阅读顺序。    按段落和表格单元翻译,不按固定字符数切割。    使用术语库和翻译记忆库保证同一术语前后一致。    检查数字、日期、单位、专有名词、表格行列是否改变。    重建 DOCX、PDF 或双语对照文档。PaddleOCR-VL 支持 109 种语言,PP-StructureV3 可以输出带版面信息的 Markdown/JSON;PP-DocTranslation 本身就是复杂版面文档翻译管线,可将翻译后端换成本地 Qwen 接口。PaddleOCR、PP-DocTranslation常用格式建议这样处理:格式	处理方式DOCX	直接修改 OOXML 文本节点,尽量保留样式PPTX	翻译文本框、表格和备注,保留坐标XLSX	逐单元格翻译,保护公式和数字PDF	提取文字层;扫描件走 OCRPNG/JPG/TIFF	OCR 后重建 DOCX/PDFHTML/MD/TXT	直接解析和翻译需要注意:PDF 的中俄文长度差异很大,“像素级保持原版式”不能百分百保证。实际生产中最好同时输出“尽量保持版式版本”和“双语 DOCX 版本”。2. 俄语转文字优先使用 Qwen3-ASR-1.7B,而不是 Whisper。它明确支持俄语、长音频、流式和离线推理;搭配 Qwen3-ForcedAligner 可以生成俄语词级时间戳。Qwen3-ASR 官方模型卡流程建议:    FFmpeg 统一转成 16kHz 单声道;    Qwen3-ASR 生成原始俄语文本;    ForcedAligner 添加句子/词级时间戳;    主模型只负责标点修复、分段和专有名词纠错;    同时保留“原始转写”和“清洗后文本”,防止大模型改写原意。如果是多人会议,还需要再增加说话人分离模型。3. 多文档检索、总结与综合分析推荐使用:    Qwen3-Embedding-4B:生成中英俄跨语言向量;    Qdrant:保存向量、原文、文档名、页码和章节;    Qdrant BM25:精确关键词检索;    Qwen3-Reranker-0.6B:对候选内容二次排序;    Qwen3.5:根据检索内容生成带出处的结论。Qwen3 Embedding/Reranker 支持 100 多种语言和最长 32K 输入。Qwen3 Embedding 官方说明Qdrant 可以在一次查询中融合语义向量和 BM25 关键词结果。Qdrant 混合检索建议检索参数:    按标题、段落和表格切块,每块约 500–1000 token;    语义检索与 BM25 各取 30–50 条;    融合后用 Reranker 重排;    最终给主模型 8–15 条证据;    每个结论必须带“文档名、页码、章节”;    全库总结采用“逐文档总结 → 主题合并 → 总体归纳”,不要把所有全文一次塞进上下文。服务架构建议全部用 Docker 隔离:    vLLM:两个 Qwen3.5 服务;    PaddleOCR:OCR/版面服务;    Qwen-ASR:语音服务;    Embedding/Reranker:检索模型服务;    Qdrant:向量和 BM25;    PostgreSQL:用户、任务、文档元数据;    MinIO:原始文件和结果文件;    Redis + Celery:长任务队列;    FastAPI:统一接口;    Open WebUI 或自建前端:上传、翻译、转写和知识库问答。主模型可以先这样启动:CUDA_VISIBLE_DEVICES=0,1 vllm serve Qwen/Qwen3.5-35B-A3B-FP8 \  --tensor-parallel-size 2 \  --max-model-len 131072 \  --gpu-memory-utilization 0.92 \  --language-model-only \  --reasoning-parser qwen3 \  --port 8001翻译实例使用 GPU 2、3,建议先限制为 64K 上下文,并在请求中传入:{  "chat_template_kwargs": {    "enable_thinking": false  }}4090 没有 NVLink。初次部署可先用兼容性较好的 TP=2;稳定后再测试 PP=2。vLLM 官方指出,无 NVLink 的机器有时流水线并行通信开销更低。vLLM 多卡部署说明“纯 GPU”需要说明可以做到所有神经网络推理都在 GPU 上、不做 CPU offload,但下面这些仍然由 CPU 完成:    PDF/DOCX/PPTX 解包;    音频解码;    文档重建;    Qdrant/PostgreSQL;    队列调度和网络服务。因此不建议使用 KTransformers 或 llama.cpp 的 CPU-GPU 混合卸载。机器最好有:    256GB 内存,最低建议 128GB;    2–4TB NVMe;    32 核以上 CPU;    足够的 PCIe 通道;    4kW 左右供电和散热能力。下一步如果要我直接给出可运行的 docker-compose.yml、GPU 绑定、目录结构和 FastAPI 接口,需要你补充:Ubuntu 版本、CPU/内存/NVMe、主要翻译语言对、并发人数,以及是否必须保持原文件格式。