评审会上客户 IT 主管只问了一句:"你们这模型,数据往哪传?" 我说走云端 API——POC 当场停摆 ❌ 前面 01~05 把清洗、检索、Rerank、HyDE 全在内网调好了,生成环节一出域,所有合规努力清零。金融/政务/医疗,这一条就是一票否决。 图里把私有化拆成「Ollama 跑生成 + vLLM 跑 Rerank」两路,一张 24G 卡全装下 👇 ① 分工:Ollama 只跑生成,Rerank 是另一种模型,Ollama 加载直接报错,得另起 vLLM ② 选型:Ollama 入门首选(API 兼容 OpenAI),迁 vLLM 只改 base_url,业务代码一行不动 ③ 起服务:docker run 三个环境变量治并发排队/换模型/冷启动,KEEP_ALIVE=24h 让模型常驻显存 ④ Rerank:vLLM ≥0.6 跑 bge-reranker-v2-m3,接口是 /v1/rerank;输出是 raw logits 不是 0~1 分,别拿来做阈值截断 ⑤ 生产基线:防火墙收口 + Nginx 反代 + GPU 监控 + Rerank 超时降级 + 请求级 trace 实测对比(RTX 4090 24G,7B):纯 CPU 0.2~0.5 tok/s ❌ → FP16 约 45 tok/s / 14GB → Q4_K_M 约 60 tok/s / 6GB ✅ Q4 才是甜点位:精度损失可接受,显存省一半,剩下的正好塞 Rerank。 ⚠️ 最致命的坑:端口绑了 0.0.0.0 结果机器还挂着公网。Ollama 本身没鉴权,被扫到就是白嫖算力 + 数据外泄——内网直连的前提是"不暴露公网",不是"裸奔"。 可抄的 docker run 命令 + docker-compose.rerank.yml 都在图里 👆 📌 合集第 6 / 8 篇,上一篇:HyDE 查询扩展(05),下一篇:Dify 工作流编排(07) #私有化部署 #Ollama #vLLM #Qwen #数据安全 #RAG #智能客服 #大模型落地 #AI工程化 #Dify
数据不上云Ollama私有化部署
作者:数据不上云Ollama私有化部署