• Latest
Open-Weights LLMs 2026

2026年开源权重LLM实战手册

8 6 月, 2026
Anthropic Forced to Shut Down Fable 5 and Mythos 5 After U.S. Export Order

美国出口管制令迫使Anthropic关停Fable 5与Mythos 5

14 6 月, 2026
Agentic Coding. How AI Writes, Tests, Debugs, and Ships Software

什么是智能体编程?理解AI如何编写、测试、调试与交付软件

14 6 月, 2026
AI News
  • 首页
  • AI新闻
  • AI视频
  • AI音频
  • 本地AI
  • 垂直领域AI
  • 智能体 AI
  • AI编程
  • AI工具
  • AI提供商
    • Anthropic
    • OpenAI
    • Amazon AWS
    • NVIDIA
    • Apple
    • Google
    • Meta
    • Microsoft
    • Mistral AI
    • DeepSeek
    • 阿里巴巴
    • MiniMax
  • 开源AI
  • AI术语表
  • 中文 (中国)
    • English
    • Español
    • Português
    • 中文 (中国)
No Result
View All Result
SAVED POSTS
AI News
  • 首页
  • AI新闻
  • AI视频
  • AI音频
  • 本地AI
  • 垂直领域AI
  • 智能体 AI
  • AI编程
  • AI工具
  • AI提供商
    • Anthropic
    • OpenAI
    • Amazon AWS
    • NVIDIA
    • Apple
    • Google
    • Meta
    • Microsoft
    • Mistral AI
    • DeepSeek
    • 阿里巴巴
    • MiniMax
  • 开源AI
  • AI术语表
  • 中文 (中国)
    • English
    • Español
    • Português
    • 中文 (中国)
No Result
View All Result
aplicar.AI
No Result
View All Result
首页 AI提供商 Amazon AWS
Open-Weights LLMs 2026

Open-Weights LLMs 2026

2026年开源权重LLM实战手册

Aplicar.AI 编辑团队 by Aplicar.AI 编辑团队
8 6 月, 2026
in Amazon AWS, AI 算力, Apple, DeepSeek, MiniMax, Mistral AI, Moonshot AI, NVIDIA, 垂直领域AI, 本地AI, 阿里巴巴
0
Share via emailShare via WhatsappShare to Facebook
  • EnglishEnglish
  • EspañolEspañol
  • PortuguêsPortuguês
  • 中文 (中国)中文 (中国)

一份在生产环境中运行开源模型的实用指南:针对不同任务选择哪个模型、规模多大、以及需要在什么硬件上运行——涵盖 CUDA 和 MLX 两类方案。

更新于2026年5月 — 覆盖2026年4月发布浪潮(DeepSeek V4、Qwen 3.6、Kimi K2.6)。


为什么只关注开源权重

封闭 API 使用起来很简单。你付费,然后就能拿到答案。但真正有意思的工程挑战——以及大部分的误解——都发生在开源权重这边,因为你需要真正去考虑参数量、MoE 架构、量化、显存,还有你的 Mac Studio 能否真的跑起来别人在推特上提到的那个1.6T模型。

本指南只涉及开源权重。下面提到的所有模型都可以下载,在你自己的硬件上运行,并部署到产品中,而无需按 token 付费。代价是你需要理解硬件。这正是本指南大部分内容要讲的东西。

关于时效性的一点说明:开源权重的前沿发展速度非常快——本指南中最重要的三个模型(DeepSeek V4、Qwen 3.6、Kimi K2.6)全部都是在2026年4月短短30天内发布的。具体的版本号会持续变化,但架构模式和硬件规格不会。


第一部分 — 2026年值得关注的开源模型

大约有7个模型系列值得在生产工作中关注。列表中未出现的要么是研究产物,要么是这些模型中的更小变体。


DeepSeek — V4 系列(2026年4月24日发布)

DeepSeek V4 是当前开源权重的前沿模型。两个变体同时发布,均采用 MIT 许可,均支持100万 token 上下文。主要的架构变化是混合型压缩稀疏注意力(Compressed Sparse Attention)+ 重度压缩注意力(Heavily Compressed Attention),将推理 FLOPs 降低到 V3.2 的约27%,在100万上下文长度下,KV 缓存占用降低了约10%。

你实际会用到的规模:

  • DeepSeek V4-Pro(MoE, 490亿活跃参数 / 1.6万亿总参数)— 前沿级别,在编码/推理方面与 Claude Opus 和 GPT-5 竞争。
  • DeepSeek V4-Flash(MoE, 130亿活跃参数 / 2840亿总参数)— 快速、高效,大多数团队能够负担的多 GPU 设备即可运行。
  • DeepSeek R1(仍在维护,MoE 370亿/6710亿参数)— 专注于推理的前代版本;如果你已经部署了它,或者想要一个更小的前沿推理选项,它仍然很有用。

许可协议: MIT。不能再纯粹了。

实际应用场景:

  1. 为受监管企业自托管的”私有GPT-5” — 例如巴西银行、美国国防承包商。在私有数据中心使用8张 H200 运行 V4-Pro,是2026年当无法将数据发送到封闭 API 但需要前沿质量的场景下的标准答案。
  2. 大规模高吞吐编码流水线。 V4-Flash 可以高效处理代码合并请求、代码审查、重构建议、自动化迁移工具。凭借130亿活跃参数,单 GPU 吞吐量表现出色,硬件之外的每 token 成本可以忽略。
  3. 长上下文文档分析 — 处理半年前还只能通过 API 实现的大规模长文本。V4 带有新注意力机制的100万上下文在长距离上确实有效(KV 缓存不会爆炸)。适用于法律文件发现、科学文献综述、完整代码库分析。
  4. 通过 DeepSeek API 实现低成本推理(如果你不想自托管)。V4-Flash 的输入价格是每百万 token 0.14美元,大约是 GPT-5 旗舰款的18分之一,对于大多数生产工作来说性能足够。
  5. 专有微调的基础前沿模型。 MIT 许可使得商业微调在法律上非常干净——这对于希望在开源基础之上构建可防守模型的垂直 SaaS 产品来说非常重要。

硬件现实: V4-Pro 在全精度下需要一个 8× H100/H200 集群。V4-Flash 在2-4张 H100 上以 FP8 精度运行良好;如果是单用户推理,一台高端 Mac Studio 采用重度量化也能胜任。大多数团队将通过 API 使用 V4-Pro,并在需要控制权时自托管 V4-Flash。


Moonshot — Kimi K2.6(2026年4月发布)

截至2026年中,Kimi K2.6 是最强的开源权重编码模型——在所有相关的自主长周期编码任务基准测试中名列前茅。原生 INT4 QAT(量化感知训练),意味着它经过专门设计,可以在量化后运行且不损失质量。包含”智能体集群”能力——可以编排多达300个并行子智能体。

你实际会用到的规模:

  • Kimi K2.6(MoE, 320亿活跃参数 / 1万亿总参数)— 原生 INT4,支持视觉,256K 上下文。
  • Kimi K2.5(前代版本)— 仍在广泛部署中,托管成本更低。

许可协议: 修改版 MIT(几乎所有商业用途免费;月活跃用户超过1亿或月收入超过2000万美元时需要注明出处)。

实际应用场景:

  1. 生产级智能体编码产品(Cursor / Devin 的开源替代方案)。K2.6 是2026年多个此类产品背后的模型。对于风投支持的 AI 编码初创公司来说,超越了 API 的经济效益。
  2. 企业代码库的自托管代码审查和 PR 分析。 原生 INT4 量化在这里至关重要——你能够以比 V4-Pro 明显更低的硬件成本获得前沿编码质量。
  3. 长周期自主任务 — Moonshot 演示了 K2.6 在12小时内执行超过4000次工具调用以完成一个真正的工程项目。适用于隔夜批处理智能体工作(代码库迁移、大规模重构、文档生成)。
  4. 多语言代码库(Rust + Go + Python + 前端 + DevOps)。K2.6 跨语言的泛化能力优于大多数专门用于编码的模型(后者通常偏向 Python)。
  5. 在自己硬件上部署前沿编码能力构成竞争优势的应用 — 国防软件、金融交易系统、医疗设备固件。代码本身就是知识产权,不能外泄。

硬件现实: 原生 INT4 意味着 K2.6 确实可以在4张 H100 或2张 H200 上部署,这比 V4-Pro 容易实现得多。重度量化可以在256GB 的 Mac Studio 上为单用户推理运行。


阿里巴巴 — Qwen 3.5 / 3.6 系列

最全面的开源系列。覆盖从低于10亿参数到1万亿参数的旗舰 MoE 的每一个尺寸等级。Qwen 3.5(2026年2月)是主要代表作更新;Qwen 3.6(2026年3-4月)是在其基础上进行的专注于智能体编码的更新。两个系列都在积极维护。

你实际会用到的规模(Qwen 3.5 / 3.6 混合):

  • Qwen 3.5 4B / 9B / 27B(稠密型)— 强大的全能选手。特别是9B 版本在 GPQA Diamond 上得分81.7,对于低于300亿参数的模型来说是前所未有的。
  • Qwen 3.6 27B(稠密型)— 27B 的更新版本,拥有更好的智能体编码能力。
  • Qwen 3.6 35B-A3B(MoE, 30亿活跃参数 / 350亿总参数)— 2026年整个开源生态系统的吞吐量甜区。拥有350亿参数的输出质量,但只有30亿参数级别的速度。
  • Qwen 3.5 122B-A10B(MoE, 100亿活跃参数 / 1220亿总参数)— 可以在64GB 的 Mac 上运行。
  • Qwen 3.5-397B-A17B 旗舰版(MoE, 170亿活跃参数 / 3970亿总参数)— 前沿级别。
  • Qwen 3.6-Max-Preview — 目前仅通过 API 提供,非开源权重;此处提到仅因为其开源权重的3.6衍生版由此而来。

许可协议: 约30B及以下规模为 Apache 2.0;更大尺寸的旗舰版为自定义协议(商业可用)。

实际应用场景:

  1. 全球产品的多语言客户支持 — Qwen 处理中文、日文、韩文、印尼文、越南文、印地文、阿拉伯文、葡萄牙文、西班牙文的质量是 Llama 无法比拟的。任何拥有大量非英语流量的产品的默认选择。
  2. 经济高效的高吞吐量聊天后端。 Qwen 3.6 35B-A3B 每 GPU 同时服务的用户数比相同规模(300亿参数级)的稠密模型多3-5倍,因为每 token 只有30亿参数是活跃的。2026年生产服务的性价比之选。
  3. Apple Silicon 上的本地智能体编码。 Qwen 3.6 35B-A3B 可以通过 MLX 在64GB 的 M 系列 MacBook Pro 上流畅运行。这个组合(MLX + 35B-A3B MoE)正成为标准独立开发者配置。
  4. 亚太地区的本地部署,采购方偏好或要求使用中国起源的模型。
  5. 垂直 SaaS 的微调基础。 Qwen 3.5 4B–14B 规模是生态系统中性价比最高的微调基础——足够小,可以在单 GPU 上微调;能力也足够,可以部署产品。
  6. 边缘部署。 Qwen 3.5 0.8B 和 2B 规模可以在手机和物联网设备上运行——适用于移动应用的离线 AI 功能。

Meta — Llama 4 系列

世界上支持最广泛的开源产品线。每个推理框架、微调库和工具集成都首先支持 Llama。Llama 4 引入了 MoE(Scout + Maverick)和原生多模态。Llama 3.3 70B 仍然是稠密型的主力;Llama 4 Behemoth(2880亿活跃参数 / 约2万亿总参数)被宣布为教师模型,但尚未作为开源权重发布。

你实际会用到的规模:

  • Llama 3.3 70B(稠密型)— 仍然是生产环境中部署最广的开源 70B 模型。
  • Llama 4 Scout(MoE, 170亿活跃参数 / 1090亿总参数,16个专家)— 在单张 H100 上通过 INT4 量化即可运行,支持1000万 token 上下文。
  • Llama 4 Maverick(MoE, 170亿活跃参数 / 4000亿总参数,128个专家)— 适合单台 H100 DGX 主机(8× H100),支持100万上下文,原生多模态。

许可协议: Llama 4 社区许可。对大多数用户友好;月活跃用户超过7亿需要特殊许可。截至2026年初,不向欧盟注册的公司提供——对于欧洲部署来说是一个重要的陷阱。

实际应用场景:

  1. 基于公司内部维基/文档训练的内部助手。 在内部文档上对 Llama 3.3 70B 进行 LoRA 微调,通过单张 H100 上的 vLLM 提供服务,为每位员工提供一个私有的 ChatGPT 等效产品。这是最常见的 Llama 部署模式。
  2. 文档库上的多模态 RAG(包含图表的 PDF、扫描表格、图表)。Llama 4 Scout 的原生图像理解能力加上1000万上下文长度,可以通过一个模型处理这种情况。
  3. 长文档工作流 — 完整代码库分析、书籍长度文档处理、多轮会话记忆。Scout 的1000万上下文长度在这里确实非常有用。
  4. 需要在欧盟以外自托管的多租户 SaaS。 Llama 是最安全的开源选择,因为你需要用到的每个依赖(vLLM, TGI, Ollama, llama.cpp, MLX)都从发布第一天起就支持它。
  5. 需要最大库支持支持的微调团队。 Llama 是生态系统中文档最全面、支持最完善的微调基础。

Mistral

欧洲的旗舰实验室。务实、许可协议良好、专注于代码。相比 DeepSeek 或 Kimi,营销炒作较少,但更可靠。鉴于 Llama 4 在欧盟不可用,这一点尤其重要。

你实际会用到的规模:

  • Mistral Small 3(约240亿参数稠密型)— 高效,指令遵循能力强。
  • Mistral Medium / Large 3 — 前沿级别的稠密型和 MoE 旗舰。
  • Codestral / Devstral — 代码专用版本;Devstral 针对智能体多文件编码进行了调优。
  • Magistral(约240亿参数推理模型)— 开源推理模型。

许可协议: 大多数发布版本为 Apache 2.0。

实际应用场景:

  1. 欧洲中型企业符合 GDPR 规定的本地聊天机器人。 随着 Llama 4 在欧盟不可用,Mistral 已成为欧洲企业在开源选择上的默认选项。
  2. 编辑多个文件的智能体编码工具。 Devstral 专为此目标构建——它是几个不希望使用中国起源模型的开源 Cursor 替代方案背后的模型。
  3. 产品功能的函数调用后端。 Mistral 系列无需特殊提示工程即可可靠地输出结构化 JSON。常用于”自然语言 → 结构化查询”功能。
  4. 欧盟语言(法语、葡萄牙语、意大利语、西班牙语)的文档处理,在这些语言方面,Mistral 相比 Qwen 和中国模型具有可测量的优势。
  5. 单 GPU 上的低成本本地编码助手。 Devstral 24B 可以在24GB 显存的 GPU 上流畅运行,处理实际的重构任务。

Google — Gemma 系列

Google 对 Llama 和 Qwen 的开源回应。采用 Apache 2.0 许可,规模从约10亿到约300亿参数,最新一代支持视觉和工具调用。

你实际会用到的规模:

  • Gemma 4 9B — 强大的小型模型,支持视觉和工具调用。
  • Gemma 4 27B — 中型稠密模型;指令遵循能力强。

许可协议: Apache 2.0。

实际应用场景:

  1. 在普通硬件上支持工具调用的本地智能体。 Gemma 4 9B 在16GB GPU 上即可可靠地处理函数调用——适用于桌面助手、浏览器扩展、轻量级自动化。
  2. 视觉+文本提取流程,无需支付 API 费用——读取截图、提取图表数据、处理扫描表格。
  3. 移动应用、信息亭、工业设备的边缘或设备端部署。 Gemma 是为此优化最好的开源系列。
  4. 法律上要求使用 Apache 2.0 许可的应用。 某些采购流程和开源软件分发明确要求使用 OSI 批准的许可协议。Gemma 和 Mistral 是最干净的选择。
  5. 在 Google Cloud / Vertex AI 上的工作负载,Gemma 在这些平台上拥有一流的基础设施支持。

NVIDIA — Nemotron 系列

NVIDIA 的开源发布,主要展示其训练和推理栈的能力。如果你已经深度投资于 CUDA/TensorRT/NeMo,值得考虑。

你实际会用到的规模:

  • Nemotron Nano(约40亿–90亿参数)— 高效的推理模型。
  • Nemotron Cascade / Ultra — 更大的、针对推理调优的 MoE 变体。

许可协议: 因发布版本而异;大多为许可宽松的开源权重。

实际应用场景:

  1. 在 H100/H200/B200 上榨取每 token/秒吞吐量的生产推理。 Nemotron 与 TensorRT-LLM 协同设计,在相同的 NVIDIA 硬件上,其吞吐量比等效的 Llama/Qwen 可测量地更高。
  2. NVIDIA NIM 微服务上的推理工作负载 — 如果你的平台团队已经标准化了 NIM,那么 Nemotron 是阻力最小的路径。
  3. 已经使用 NVIDIA NeMo 的微调团队。 停留在一个工具链内在运营层面上价值很大。

请继续阅读本文的第二部分。

2026年开源权重LLM实战手册 – 第二部分

标签: Codestral / DevstralCUDADeepSeek R1DeepSeek V4-FlashDeepSeek V4-ProGemma 4Kimi K2Llama 4MagistralMistralMLXNemotronQwen大语言模型(LLM)
SendSendShare
Aplicar.AI 编辑团队

Aplicar.AI 编辑团队

我们是 Aplicar.AI 编辑团队,专为想要超越理论、真正用好人工智能的读者而设。我们注重实操:手把手的分步教程、实用指南、工具对比,以及可以立即应用到工作、业务或学习中的真实案例。 AI 发展日新月异,而我们的使命是把它讲清楚、讲实用:解释 AI 的实际运作原理,并告诉你如何充分发挥它的价值——无论你是刚刚入门,还是正在搭建高级的自动化工作流。 从通俗易懂的入门讲解到深入的分析,从新手教程到生产级的工作流,我们的目标始终如一:让 AI 知识触手可及,帮助每一个人和企业把它真正用起来。 我们借助人工智能创作内容,但始终坚持人工审核与编辑把关——因为清晰、准确和透明是我们不可妥协的原则。

相关故事

How to Cut AI Coding Costs with Claude, Qwen, and DeepSeek

停止支付高昂费用:如何利用Claude、Qwen和DeepSeek降低AI编码成本

by Aplicar.AI 编辑团队
8 6 月, 2026
0

如果你的团队将所有编程任务都交给一个顶级AI模型,很可能...

The Qwen Family: Open-Weight AI from Alibaba

通义千问完全指南:阿里这一手开源大模型,到底香在哪儿?

by Aplicar.AI 编辑团队
8 6 月, 2026
0

2026 年的 AI 圈,热闹得有点儿离谱。OpenAI...

AnythingLLM, Open Source, Private, Local

AnythingLLM实践指南:安装、使用与真实场景搭建

by Aplicar.AI 编辑团队
8 6 月, 2026
0

如果你曾暗自思忖过:"我到底能不能把这份合同直接粘贴到C...

Running NVIDIA's Nemotron Open Models on Your Mac with MLX

在 Mac 上使用 MLX 运行 NVIDIA Nemotron 开放模型

by Aplicar.AI 编辑团队
14 6 月, 2026
0

在 Mac 上使用 MLX 运行 NVIDIA Nemo...

Next Post
Anthropic Claude Training

为何你应该参加Anthropic Claude培训(以及真实收获)

发表回复 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

学习与应用 AI

Aplicar.AI logo

AI 发展迅速。我们帮助你跟上步伐,理解重要的内容,并加以应用——你需要的一切学习和应用 AI 的资源都在这里。

最新文章

  • 美国出口管制令迫使Anthropic关停Fable 5与Mythos 5
  • 什么是智能体编程?理解AI如何编写、测试、调试与交付软件
  • 停止支付高昂费用:如何利用Claude、Qwen和DeepSeek降低AI编码成本

分类

  • AI 算力
  • AI工具
  • AI新闻
  • AI编程
  • AI视频
  • AI音频
  • Amazon AWS
  • Anthropic
  • Apple
  • DeepSeek
  • Google
  • Microsoft
  • MiniMax
  • Mistral AI
  • Moonshot AI
  • NVIDIA
  • OpenAI
  • 垂直领域AI
  • 开源AI
  • 智能体 AI
  • 本地AI
  • 模型推理
  • 阿里巴巴

标签

AI benchmarks AI 智能体 AI网络安全 AI 认证 Apple Silicon AWS Bedrock Claude AI Claude Code Claude Mythos Codestral / Devstral CUDA Cursor DeepSeek R1 DeepSeek V4-Flash DeepSeek V4-Pro Gemini AI Gemma 4 GitHub Copilot Kimi K2 Llama 4 Magistral MCP Mistral MLX Nemotron OpenAI Codex OpenAI GPT Qwen Qwen-Coder Qwen-Image Qwen-Math Qwen-Omni Qwen-VL Tensor Processing Unit (TPU) Trainium Wan 大语言模型(LLM) 对比评测 教程 高级
  • 关于我们
  • 联系我们
  • 我们如何使用人工智能
  • English
  • Español
  • Português
  • 中文 (中国)

© 2026 Aplicar.AI - 学习与运用 AI

Welcome Back!

Login to your account below

Forgotten Password?

Retrieve your password

Please enter your username or email address to reset your password.

Log In

我们使用 Cookie 为您提供最佳的网站体验。 您可以在 中了解我们使用的 Cookie 或将其关闭。

No Result
View All Result
  • 首页
  • AI新闻
  • AI视频
  • AI音频
  • 本地AI
  • 垂直领域AI
  • 智能体 AI
  • AI编程
  • AI工具
  • AI提供商
    • Anthropic
    • OpenAI
    • Amazon AWS
    • NVIDIA
    • Apple
    • Google
    • Meta
    • Microsoft
    • Mistral AI
    • DeepSeek
    • 阿里巴巴
    • MiniMax
  • 开源AI
  • AI术语表
  • 中文 (中国)
    • English
    • Español
    • Português
    • 中文 (中国)

© 2026 Aplicar.AI - 学习与运用 AI

Privacy Overview
学习与应用AI

This website uses cookies so that we can provide you with the best user experience possible. Cookie information is stored in your browser and performs functions such as recognising you when you return to our website and helping our team to understand which sections of the website you find most interesting and useful.

Necessary

Strictly Necessary Cookie should be enabled at all times so that we can save your preferences for cookie settings.

技术支持来自  GDPR Cookie Compliance