一份在生产环境中运行开源模型的实用指南:针对不同任务选择哪个模型、规模多大、以及需要在什么硬件上运行——涵盖 CUDA 和 MLX 两类方案。
更新于2026年5月 — 覆盖2026年4月发布浪潮(DeepSeek V4、Qwen 3.6、Kimi K2.6)。
为什么只关注开源权重
封闭 API 使用起来很简单。你付费,然后就能拿到答案。但真正有意思的工程挑战——以及大部分的误解——都发生在开源权重这边,因为你需要真正去考虑参数量、MoE 架构、量化、显存,还有你的 Mac Studio 能否真的跑起来别人在推特上提到的那个1.6T模型。
本指南只涉及开源权重。下面提到的所有模型都可以下载,在你自己的硬件上运行,并部署到产品中,而无需按 token 付费。代价是你需要理解硬件。这正是本指南大部分内容要讲的东西。
关于时效性的一点说明:开源权重的前沿发展速度非常快——本指南中最重要的三个模型(DeepSeek V4、Qwen 3.6、Kimi K2.6)全部都是在2026年4月短短30天内发布的。具体的版本号会持续变化,但架构模式和硬件规格不会。
第一部分 — 2026年值得关注的开源模型
大约有7个模型系列值得在生产工作中关注。列表中未出现的要么是研究产物,要么是这些模型中的更小变体。
DeepSeek — V4 系列(2026年4月24日发布)
DeepSeek V4 是当前开源权重的前沿模型。两个变体同时发布,均采用 MIT 许可,均支持100万 token 上下文。主要的架构变化是混合型压缩稀疏注意力(Compressed Sparse Attention)+ 重度压缩注意力(Heavily Compressed Attention),将推理 FLOPs 降低到 V3.2 的约27%,在100万上下文长度下,KV 缓存占用降低了约10%。
你实际会用到的规模:
- DeepSeek V4-Pro(MoE, 490亿活跃参数 / 1.6万亿总参数)— 前沿级别,在编码/推理方面与 Claude Opus 和 GPT-5 竞争。
- DeepSeek V4-Flash(MoE, 130亿活跃参数 / 2840亿总参数)— 快速、高效,大多数团队能够负担的多 GPU 设备即可运行。
- DeepSeek R1(仍在维护,MoE 370亿/6710亿参数)— 专注于推理的前代版本;如果你已经部署了它,或者想要一个更小的前沿推理选项,它仍然很有用。
许可协议: MIT。不能再纯粹了。
实际应用场景:
- 为受监管企业自托管的”私有GPT-5” — 例如巴西银行、美国国防承包商。在私有数据中心使用8张 H200 运行 V4-Pro,是2026年当无法将数据发送到封闭 API 但需要前沿质量的场景下的标准答案。
- 大规模高吞吐编码流水线。 V4-Flash 可以高效处理代码合并请求、代码审查、重构建议、自动化迁移工具。凭借130亿活跃参数,单 GPU 吞吐量表现出色,硬件之外的每 token 成本可以忽略。
- 长上下文文档分析 — 处理半年前还只能通过 API 实现的大规模长文本。V4 带有新注意力机制的100万上下文在长距离上确实有效(KV 缓存不会爆炸)。适用于法律文件发现、科学文献综述、完整代码库分析。
- 通过 DeepSeek API 实现低成本推理(如果你不想自托管)。V4-Flash 的输入价格是每百万 token 0.14美元,大约是 GPT-5 旗舰款的18分之一,对于大多数生产工作来说性能足够。
- 专有微调的基础前沿模型。 MIT 许可使得商业微调在法律上非常干净——这对于希望在开源基础之上构建可防守模型的垂直 SaaS 产品来说非常重要。
硬件现实: V4-Pro 在全精度下需要一个 8× H100/H200 集群。V4-Flash 在2-4张 H100 上以 FP8 精度运行良好;如果是单用户推理,一台高端 Mac Studio 采用重度量化也能胜任。大多数团队将通过 API 使用 V4-Pro,并在需要控制权时自托管 V4-Flash。
Moonshot — Kimi K2.6(2026年4月发布)
截至2026年中,Kimi K2.6 是最强的开源权重编码模型——在所有相关的自主长周期编码任务基准测试中名列前茅。原生 INT4 QAT(量化感知训练),意味着它经过专门设计,可以在量化后运行且不损失质量。包含”智能体集群”能力——可以编排多达300个并行子智能体。
你实际会用到的规模:
- Kimi K2.6(MoE, 320亿活跃参数 / 1万亿总参数)— 原生 INT4,支持视觉,256K 上下文。
- Kimi K2.5(前代版本)— 仍在广泛部署中,托管成本更低。
许可协议: 修改版 MIT(几乎所有商业用途免费;月活跃用户超过1亿或月收入超过2000万美元时需要注明出处)。
实际应用场景:
- 生产级智能体编码产品(Cursor / Devin 的开源替代方案)。K2.6 是2026年多个此类产品背后的模型。对于风投支持的 AI 编码初创公司来说,超越了 API 的经济效益。
- 企业代码库的自托管代码审查和 PR 分析。 原生 INT4 量化在这里至关重要——你能够以比 V4-Pro 明显更低的硬件成本获得前沿编码质量。
- 长周期自主任务 — Moonshot 演示了 K2.6 在12小时内执行超过4000次工具调用以完成一个真正的工程项目。适用于隔夜批处理智能体工作(代码库迁移、大规模重构、文档生成)。
- 多语言代码库(Rust + Go + Python + 前端 + DevOps)。K2.6 跨语言的泛化能力优于大多数专门用于编码的模型(后者通常偏向 Python)。
- 在自己硬件上部署前沿编码能力构成竞争优势的应用 — 国防软件、金融交易系统、医疗设备固件。代码本身就是知识产权,不能外泄。
硬件现实: 原生 INT4 意味着 K2.6 确实可以在4张 H100 或2张 H200 上部署,这比 V4-Pro 容易实现得多。重度量化可以在256GB 的 Mac Studio 上为单用户推理运行。
阿里巴巴 — Qwen 3.5 / 3.6 系列
最全面的开源系列。覆盖从低于10亿参数到1万亿参数的旗舰 MoE 的每一个尺寸等级。Qwen 3.5(2026年2月)是主要代表作更新;Qwen 3.6(2026年3-4月)是在其基础上进行的专注于智能体编码的更新。两个系列都在积极维护。
你实际会用到的规模(Qwen 3.5 / 3.6 混合):
- Qwen 3.5 4B / 9B / 27B(稠密型)— 强大的全能选手。特别是9B 版本在 GPQA Diamond 上得分81.7,对于低于300亿参数的模型来说是前所未有的。
- Qwen 3.6 27B(稠密型)— 27B 的更新版本,拥有更好的智能体编码能力。
- Qwen 3.6 35B-A3B(MoE, 30亿活跃参数 / 350亿总参数)— 2026年整个开源生态系统的吞吐量甜区。拥有350亿参数的输出质量,但只有30亿参数级别的速度。
- Qwen 3.5 122B-A10B(MoE, 100亿活跃参数 / 1220亿总参数)— 可以在64GB 的 Mac 上运行。
- Qwen 3.5-397B-A17B 旗舰版(MoE, 170亿活跃参数 / 3970亿总参数)— 前沿级别。
- Qwen 3.6-Max-Preview — 目前仅通过 API 提供,非开源权重;此处提到仅因为其开源权重的3.6衍生版由此而来。
许可协议: 约30B及以下规模为 Apache 2.0;更大尺寸的旗舰版为自定义协议(商业可用)。
实际应用场景:
- 全球产品的多语言客户支持 — Qwen 处理中文、日文、韩文、印尼文、越南文、印地文、阿拉伯文、葡萄牙文、西班牙文的质量是 Llama 无法比拟的。任何拥有大量非英语流量的产品的默认选择。
- 经济高效的高吞吐量聊天后端。 Qwen 3.6 35B-A3B 每 GPU 同时服务的用户数比相同规模(300亿参数级)的稠密模型多3-5倍,因为每 token 只有30亿参数是活跃的。2026年生产服务的性价比之选。
- Apple Silicon 上的本地智能体编码。 Qwen 3.6 35B-A3B 可以通过 MLX 在64GB 的 M 系列 MacBook Pro 上流畅运行。这个组合(MLX + 35B-A3B MoE)正成为标准独立开发者配置。
- 亚太地区的本地部署,采购方偏好或要求使用中国起源的模型。
- 垂直 SaaS 的微调基础。 Qwen 3.5 4B–14B 规模是生态系统中性价比最高的微调基础——足够小,可以在单 GPU 上微调;能力也足够,可以部署产品。
- 边缘部署。 Qwen 3.5 0.8B 和 2B 规模可以在手机和物联网设备上运行——适用于移动应用的离线 AI 功能。
Meta — Llama 4 系列
世界上支持最广泛的开源产品线。每个推理框架、微调库和工具集成都首先支持 Llama。Llama 4 引入了 MoE(Scout + Maverick)和原生多模态。Llama 3.3 70B 仍然是稠密型的主力;Llama 4 Behemoth(2880亿活跃参数 / 约2万亿总参数)被宣布为教师模型,但尚未作为开源权重发布。
你实际会用到的规模:
- Llama 3.3 70B(稠密型)— 仍然是生产环境中部署最广的开源 70B 模型。
- Llama 4 Scout(MoE, 170亿活跃参数 / 1090亿总参数,16个专家)— 在单张 H100 上通过 INT4 量化即可运行,支持1000万 token 上下文。
- Llama 4 Maverick(MoE, 170亿活跃参数 / 4000亿总参数,128个专家)— 适合单台 H100 DGX 主机(8× H100),支持100万上下文,原生多模态。
许可协议: Llama 4 社区许可。对大多数用户友好;月活跃用户超过7亿需要特殊许可。截至2026年初,不向欧盟注册的公司提供——对于欧洲部署来说是一个重要的陷阱。
实际应用场景:
- 基于公司内部维基/文档训练的内部助手。 在内部文档上对 Llama 3.3 70B 进行 LoRA 微调,通过单张 H100 上的 vLLM 提供服务,为每位员工提供一个私有的 ChatGPT 等效产品。这是最常见的 Llama 部署模式。
- 文档库上的多模态 RAG(包含图表的 PDF、扫描表格、图表)。Llama 4 Scout 的原生图像理解能力加上1000万上下文长度,可以通过一个模型处理这种情况。
- 长文档工作流 — 完整代码库分析、书籍长度文档处理、多轮会话记忆。Scout 的1000万上下文长度在这里确实非常有用。
- 需要在欧盟以外自托管的多租户 SaaS。 Llama 是最安全的开源选择,因为你需要用到的每个依赖(vLLM, TGI, Ollama, llama.cpp, MLX)都从发布第一天起就支持它。
- 需要最大库支持支持的微调团队。 Llama 是生态系统中文档最全面、支持最完善的微调基础。
Mistral
欧洲的旗舰实验室。务实、许可协议良好、专注于代码。相比 DeepSeek 或 Kimi,营销炒作较少,但更可靠。鉴于 Llama 4 在欧盟不可用,这一点尤其重要。
你实际会用到的规模:
- Mistral Small 3(约240亿参数稠密型)— 高效,指令遵循能力强。
- Mistral Medium / Large 3 — 前沿级别的稠密型和 MoE 旗舰。
- Codestral / Devstral — 代码专用版本;Devstral 针对智能体多文件编码进行了调优。
- Magistral(约240亿参数推理模型)— 开源推理模型。
许可协议: 大多数发布版本为 Apache 2.0。
实际应用场景:
- 欧洲中型企业符合 GDPR 规定的本地聊天机器人。 随着 Llama 4 在欧盟不可用,Mistral 已成为欧洲企业在开源选择上的默认选项。
- 编辑多个文件的智能体编码工具。 Devstral 专为此目标构建——它是几个不希望使用中国起源模型的开源 Cursor 替代方案背后的模型。
- 产品功能的函数调用后端。 Mistral 系列无需特殊提示工程即可可靠地输出结构化 JSON。常用于”自然语言 → 结构化查询”功能。
- 欧盟语言(法语、葡萄牙语、意大利语、西班牙语)的文档处理,在这些语言方面,Mistral 相比 Qwen 和中国模型具有可测量的优势。
- 单 GPU 上的低成本本地编码助手。 Devstral 24B 可以在24GB 显存的 GPU 上流畅运行,处理实际的重构任务。
Google — Gemma 系列
Google 对 Llama 和 Qwen 的开源回应。采用 Apache 2.0 许可,规模从约10亿到约300亿参数,最新一代支持视觉和工具调用。
你实际会用到的规模:
- Gemma 4 9B — 强大的小型模型,支持视觉和工具调用。
- Gemma 4 27B — 中型稠密模型;指令遵循能力强。
许可协议: Apache 2.0。
实际应用场景:
- 在普通硬件上支持工具调用的本地智能体。 Gemma 4 9B 在16GB GPU 上即可可靠地处理函数调用——适用于桌面助手、浏览器扩展、轻量级自动化。
- 视觉+文本提取流程,无需支付 API 费用——读取截图、提取图表数据、处理扫描表格。
- 移动应用、信息亭、工业设备的边缘或设备端部署。 Gemma 是为此优化最好的开源系列。
- 法律上要求使用 Apache 2.0 许可的应用。 某些采购流程和开源软件分发明确要求使用 OSI 批准的许可协议。Gemma 和 Mistral 是最干净的选择。
- 在 Google Cloud / Vertex AI 上的工作负载,Gemma 在这些平台上拥有一流的基础设施支持。
NVIDIA — Nemotron 系列
NVIDIA 的开源发布,主要展示其训练和推理栈的能力。如果你已经深度投资于 CUDA/TensorRT/NeMo,值得考虑。
你实际会用到的规模:
- Nemotron Nano(约40亿–90亿参数)— 高效的推理模型。
- Nemotron Cascade / Ultra — 更大的、针对推理调优的 MoE 变体。
许可协议: 因发布版本而异;大多为许可宽松的开源权重。
实际应用场景:
- 在 H100/H200/B200 上榨取每 token/秒吞吐量的生产推理。 Nemotron 与 TensorRT-LLM 协同设计,在相同的 NVIDIA 硬件上,其吞吐量比等效的 Llama/Qwen 可测量地更高。
- NVIDIA NIM 微服务上的推理工作负载 — 如果你的平台团队已经标准化了 NIM,那么 Nemotron 是阻力最小的路径。
- 已经使用 NVIDIA NeMo 的微调团队。 停留在一个工具链内在运营层面上价值很大。
请继续阅读本文的第二部分。








