为什么不建议大多数企业私有部署 Qwen、DeepSeek?
滚水科技的默认建议是:大多数民营企业不应私有部署基础大模型。 Qwen、DeepSeek 权重可以下载,不代表企业能够以更低成本获得与官方服务相当的效果、并发和持续升级能力。对内部知识问答、文档处理、内容辅助和业务 Agent,优先使用成熟模型 API 或托管服务,把预算投入知识治理、权限、业务流程、系统集成和质量评测,通常更符合投入产出。
这是滚水科技基于项目方案与 PoC 评估形成的专业服务判断,属于自有经验总结,不是行业统计结论。我们不会因为客户提出“自主可控”或“开源免费”就直接推荐购买服务器;如果验证结果显示私有部署效果更差、并发不足或三年总成本更高,我们会明确建议停止采购。
为什么默认不建议私有部署
开源的是模型,不是完整的生产服务
开源模型通常提供权重、模型代码、许可证和基础运行说明。企业仍要建设推理框架、量化方案、聊天模板、工具调用、缓存、批处理、内容安全、监控、回滚和升级流程。这些工程差异会直接改变质量、显存占用、响应速度和并发。
Qwen 官方 vLLM 部署说明专门讨论 CUDA 依赖、并行方式、思考模式、聊天模板、量化和上下文配置,并提示部分长上下文配置可能影响短文本表现。DeepSeek-V3 官方仓库列出的本地运行路径依赖 SGLang、vLLM、TensorRT-LLM 等不同推理实现,其 671B 模型演示命令使用 2 个节点、每节点 8 个进程。这些公开资料说明:权重开放解决的是“允许部署”,不是替企业交付已经优化好的生产服务。
为了降低硬件门槛而换用更小模型或更激进的量化,可能进一步损失复杂推理、长文档、结构化输出和工具调用效果。模型费下降后,如果员工需要花更多时间核对、重写或转人工,业务成本反而会上升。
固定算力很难被多数企业充分利用
模型 API 按实际输入和输出量计费,业务少用时成本会下降;私有设备从采购当天起就是固定成本。多数内部助手在上班时段有零散峰值,夜间、周末和业务淡季大量闲置,却仍要承担折旧、电力、机房、备件和运维。
私有部署应按三年总拥有成本计算:
三年 TCO = 设备净成本 + 电力与制冷 + 机房与网络 + 软件与维保 + 实施迁移 + 运维人力 + 升级扩容 + 故障损失
真正可比较的单位不是“一张 GPU 多少钱”,而是:
每个合格任务成本 = 期间全部成本 ÷ 同时达到质量和响应要求的任务数
失败重试、人工复核、备用容量和模型升级都必须进入分子。如果私有方案只有在设备长期接近满载时才比 API 便宜,而企业当前没有这样的稳定负载,我们会判定经济账不成立。
“能运行”不等于“能供多人使用”
大模型先处理输入,再逐 token 生成输出。提示词长度、回答长度、思考模式和同时请求数都会争用显存与计算资源。一体机标注“支持 50 人”或展示单人对话很流畅,不能证明 50 名员工同时使用时仍然可接受。
滚水科技会使用代表性业务任务测量请求吞吐、输出 token 吞吐、首 token 延迟(TTFT)、单输出 token 时间(TPOT)以及满足延迟目标的有效吞吐。 vLLM 官方基准工具也将这些指标分开报告,并提醒不同工具的指标名称并不完全统一。没有真实输入长度、输出长度、请求到达曲线和 P95/P99 延迟的“并发数”,不能作为采购依据。
模型升级会把一次采购变成长期工程
官方模型服务会持续更新模型、推理基础设施和接口能力。私有部署则要自行处理模型格式、驱动、推理框架、安全补丁、回归测试和滚动升级。新模型装不进原有设备,或新框架暂不支持现有硬件时,企业可能在折旧期内再次扩容。
这类工作不是服务器日常运维的自然延伸。没有持续负责模型评测与推理优化的团队,设备可以一直在线,但业务效果会逐渐落后。
为什么不建议用多台 Mac mini 作为默认生产方案
Mac mini 功耗低、统一内存容量相对灵活,适合模型验证、离线处理和低并发试点,但滚水科技不建议大多数企业把多台 Mac mini 串联作为正式大模型服务的默认架构。
Apple 的 MLX LM支持 Apple 芯片上的量化和分布式推理,MLX 的分布式通信文档也提供 TCP Ring 和基于雷雳 RDMA 的 JACCL。这证明技术上可以串联,但多台机器的内存并不会自动变成一块共享内存:模型必须显式切分,每生成 token 都可能依赖跨机通信和最慢节点。
两种做法的经济意义不同:
| 做法 | 解决什么 | 我们的建议 |
|---|---|---|
| 每台运行一份完整小模型 | 增加请求吞吐和故障冗余 | 单机已达到质量目标后,可用两台做有限试点 |
| 一个大模型切到多台机器 | 解决单机内存放不下 | 不作为民营企业在线服务的默认方案,必须与标准 GPU 服务器实测比较 |
跨机方案还要增加高内存配置、10Gb 网卡或雷雳线缆、交换网络、机架、电源、备用节点、负载均衡和远程运维。Apple 当前 Mac mini 技术规格显示,M4 机型提供雷雳 4,M4 Pro 机型提供雷雳 5,以太网默认 1Gb、可选 10Gb。端口标称速率不能替代模型端到端压测。
如果一个模型必须依靠多台 Mac mini 的“内存总和”才能运行,我们的默认建议不是继续加机器,而是先换用更适合任务的小模型或成熟 API。只有数据不能出域、任务低并发且该模型确实不可替代时,才值得把 Mac 集群作为 PoC 候选;需要稳定高并发和规模化扩容时,优先评估标准 GPU 服务器或托管推理平台。
哪些情况才值得例外评估
政务、国企、军工、关键基础设施等组织更常遇到涉密网络、采购制度或数据边界要求,因此私有部署需求更常见。但组织属性本身不是技术结论:普通办公资料不一定需要自建模型,民营企业的核心研发资料也可能具有严格的出域限制。
滚水科技只在以下硬条件至少成立一项时,建议进入私有部署 PoC:
- 数据、合同或保密要求明确禁止任何必要内容进入外部模型服务;
- 系统必须在物理隔离、断网或云服务不可用的环境中运行;
- 本地实时性或连续可用性要求无法由合规的托管服务满足;
- 已有长期、稳定且足够大的真实负载,并且企业具备可复用的 GPU、机房和模型运维团队。
即使存在硬条件,也不是直接采购。目标开源模型还必须在客户确认过的业务评测集上达到质量底线,目标设备必须在真实并发下达到响应要求,三年预算必须包含冗余、升级和运维。私有部署在这类场景首先是数据边界或业务连续性投入,不应包装成必然省钱。
本地运行同样要治理模型文件、升级源、日志、备份和运维权限;具体可参照大模型应用安全合规审查指南。
大多数民营企业更适合什么方案
我们的默认方案是“应用和业务数据由企业控制,基础模型按需调用”:
| 场景 | 滚水科技的优先建议 | 原因 |
|---|---|---|
| 内部知识问答、写作、摘要 | 企业级 API + 权限化知识库 | 上线快,可持续选择更合适的模型 |
| 部分资料敏感 | 数据分级、脱敏、最小化发送 + 企业 API | 不为少量敏感任务承担整套私有集群 |
| 简单高频分类或抽取 | 本地小模型 + 复杂任务 API | 小模型承担固定任务,保留大模型效果 |
| 全部内容不得出域 | 本地模型 PoC,通过后再采购 | 先证明质量、并发和运维可接受 |
企业真正需要掌握的通常不是基础模型权重,而是知识资产、身份权限、业务规则、操作审计、供应商切换能力和质量评测集。把这些应用层能力建设好,即使以后更换模型或因合规要求转向本地部署,也不需要重做整个业务系统。
滚水科技如何给出“不部署”的专业结论
客户只需说明希望改善的工作、可用于验证的代表性材料和数据边界,并安排少量员工确认结果。滚水科技负责把初步想法转成任务评测集,先建立 API 或隔离环境基线,再用真实日志推导峰值并发和响应目标。只有硬约束成立时,我们才增加本地模型和硬件候选。
采购前的交付物包括模型质量报告、容量压测报告和 API、托管、本地小模型、一体机、Mac mini、标准 GPU 服务器的 36 个月 TCO。最终建议必须明确写成“继续使用 API”“采用混合方案”“进入私有部署 PoC”或“停止采购”,并说明依据、预算、适用规模和责任边界。
模型厂商、硬件厂商和云平台分别对其价格、许可证、设备与底层服务负责;滚水科技负责方案设计、测试口径、应用集成和约定范围内的实施。费用与第三方资源会分开说明,具体可参照滚水透明交付标准。更宽泛的用量测算可查看大模型算力成本问答。
外部产品与技术资料核对于 2026 年 8 月 25 日。模型、框架、价格和硬件能力会持续变化,正式建议以同一批业务样本、当期供应商资料和实测结果为准。