skip to main content
paste
bin
.ca
type · paste · share
⌘
K
Family
The bin family
pastebin.ca
hub
Share text and code with expiry and privacy controls.
imagebin.ca
Upload and share images with direct links.
filebin.ca
Drop a file and get a shareable link.
notebin.ca
Write Markdown notes with durable links.
turl.ca
Short, reputation-checked links.
attn.ca
Notifications and alerts for your services.
voicebin.ca
Record and share short voice clips.
dnsbin.ca
Inspect DNS and debug records.
Docs
Sign in
?
← back to paste
›
Edit / fork
Untitled paste
#6MKVVQjsYJ
public / public
new version
anonymous
created 6 days ago
Expires in 1 day
6.0 KB
syntax:
text
Your changes create a new paste linked to this one — the original is untouched.
new version
Your changes create a new paste linked to this one — the original is untouched.
Title (optional)
Filename
Syntax
text
text
bash
c
cpp
css
diff
dockerfile
go
html
ini
java
javascript
json
kotlin
lua
makefile
markdown
nginx
php
python
ruby
rust
shellscript
sql
swift
toml
typescript
xml
yaml
Visibility
Public feed
Access
public
Expires
7 days
10 min
1 hour
1 day
7 days
30 days
90 days
custom…
Custom expiry
Change note
(optional)
This paste will be listed on the public feed. Change Visibility if you only want people with the link to see it.
Create new version
Cancel
Paste or type…
我现在有七张4090,ubuntu系统,我想要部署开源的本地大模型,纯GPU使用。主要功能包括三点:1.文档翻译,包括常用格式和Ocr;2.俄语转文字;3.多个文档的内容综合分析,检索,总结 可以。按每张 4090 为 24GB 计算,7 张卡足够部署一套实用的本地“文档翻译 + 俄语转写 + 多文档知识库”系统。 我建议采用专用模型分工,不要把 7 张卡全部绑成一个超大模型。 推荐显卡分配 GPU 服务 推荐模型 用途 0–1 综合分析模型 Qwen3.5-35B-A3B-FP8 多文档分析、归纳、问答,开启思考模式 2–3 翻译模型 同一模型的第二实例 文档翻译,关闭思考模式,提高速度 4 文档解析/OCR PaddleOCR-VL-1.6 + PP-StructureV3 扫描件、PDF、表格、公式、版面识别 5 俄语语音识别 Qwen3-ASR-1.7B + ForcedAligner-0.6B 俄语转写、语言识别、时间戳 6 检索模型 Qwen3-Embedding-4B + Qwen3-Reranker-0.6B 向量化、跨语言检索、结果重排 Qwen3.5-35B-A3B 总参数 35B、每次仅激活约 3B,官方 FP8 权重约 38GB,两张 4090 可以承载一个实例;模型支持 201 种语言、262K 原生上下文,官方称 FP8 与原模型指标接近。Qwen3.5 官方模型卡4090 属于 Ada 架构,vLLM 原生支持 FP8 W8A8,因此这里选 FP8 比 INT4 更适合你的硬件。vLLM FP8 支持说明 三项功能的具体实现 1. 文档翻译与 OCR 处理流程: 原生 PDF 先提取文字层。 扫描 PDF、图片、TIFF 使用 PaddleOCR。 识别标题、段落、表格、公式、图片及阅读顺序。 按段落和表格单元翻译,不按固定字符数切割。 使用术语库和翻译记忆库保证同一术语前后一致。 检查数字、日期、单位、专有名词、表格行列是否改变。 重建 DOCX、PDF 或双语对照文档。 PaddleOCR-VL 支持 109 种语言,PP-StructureV3 可以输出带版面信息的 Markdown/JSON;PP-DocTranslation 本身就是复杂版面文档翻译管线,可将翻译后端换成本地 Qwen 接口。PaddleOCR 、PP-DocTranslation 常用格式建议这样处理: 格式 处理方式 DOCX 直接修改 OOXML 文本节点,尽量保留样式 PPTX 翻译文本框、表格和备注,保留坐标 XLSX 逐单元格翻译,保护公式和数字 PDF 提取文字层;扫描件走 OCR PNG/JPG/TIFF OCR 后重建 DOCX/PDF HTML/MD/TXT 直接解析和翻译 需要注意:PDF 的中俄文长度差异很大,“像素级保持原版式”不能百分百保证。实际生产中最好同时输出“尽量保持版式版本”和“双语 DOCX 版本”。 2. 俄语转文字 优先使用 Qwen3-ASR-1.7B,而不是 Whisper。它明确支持俄语、长音频、流式和离线推理;搭配 Qwen3-ForcedAligner 可以生成俄语词级时间戳。Qwen3-ASR 官方模型卡 流程建议: FFmpeg 统一转成 16kHz 单声道; Qwen3-ASR 生成原始俄语文本; ForcedAligner 添加句子/词级时间戳; 主模型只负责标点修复、分段和专有名词纠错; 同时保留“原始转写”和“清洗后文本”,防止大模型改写原意。 如果是多人会议,还需要再增加说话人分离模型。 3. 多文档检索、总结与综合分析 推荐使用: Qwen3-Embedding-4B:生成中英俄跨语言向量; Qdrant:保存向量、原文、文档名、页码和章节; Qdrant BM25:精确关键词检索; Qwen3-Reranker-0.6B:对候选内容二次排序; Qwen3.5:根据检索内容生成带出处的结论。 Qwen3 Embedding/Reranker 支持 100 多种语言和最长 32K 输入。Qwen3 Embedding 官方说明 Qdrant 可以在一次查询中融合语义向量和 BM25 关键词结果。Qdrant 混合检索 建议检索参数: 按标题、段落和表格切块,每块约 500–1000 token; 语义检索与 BM25 各取 30–50 条; 融合后用 Reranker 重排; 最终给主模型 8–15 条证据; 每个结论必须带“文档名、页码、章节”; 全库总结采用“逐文档总结 → 主题合并 → 总体归纳”,不要把所有全文一次塞进上下文。 服务架构 建议全部用 Docker 隔离: vLLM:两个 Qwen3.5 服务; PaddleOCR:OCR/版面服务; Qwen-ASR:语音服务; Embedding/Reranker:检索模型服务; Qdrant:向量和 BM25; PostgreSQL:用户、任务、文档元数据; MinIO:原始文件和结果文件; Redis + Celery:长任务队列; FastAPI:统一接口; Open WebUI 或自建前端:上传、翻译、转写和知识库问答。 主模型可以先这样启动: CUDA_VISIBLE_DEVICES=0,1 vllm serve Qwen/Qwen3.5-35B-A3B-FP8 \ --tensor-parallel-size 2 \ --max-model-len 131072 \ --gpu-memory-utilization 0.92 \ --language-model-only \ --reasoning-parser qwen3 \ --port 8001 翻译实例使用 GPU 2、3,建议先限制为 64K 上下文,并在请求中传入: { "chat_template_kwargs": { "enable_thinking": false } } 4090 没有 NVLink。初次部署可先用兼容性较好的 TP=2;稳定后再测试 PP=2。vLLM 官方指出,无 NVLink 的机器有时流水线并行通信开销更低。vLLM 多卡部署说明 “纯 GPU”需要说明 可以做到所有神经网络推理都在 GPU 上、不做 CPU offload,但下面这些仍然由 CPU 完成: PDF/DOCX/PPTX 解包; 音频解码; 文档重建; Qdrant/PostgreSQL; 队列调度和网络服务。 因此不建议使用 KTransformers 或 llama.cpp 的 CPU-GPU 混合卸载。机器最好有: 256GB 内存,最低建议 128GB; 2–4TB NVMe; 32 核以上 CPU; 足够的 PCIe 通道; 4kW 左右供电和散热能力。 下一步如果要我直接给出可运行的 docker-compose.yml、GPU 绑定、目录结构和 FastAPI 接口,需要你补充:Ubuntu 版本、CPU/内存/NVMe、主要翻译语言对、并发人数,以及是否必须保持原文件格式。