Cómo elegir, dimensionar y desplegar modelos de pesos abiertos en producción: qué modelo para qué tarea, de qué tamaño, y sobre qué hardware — cubriendo CUDA y MLX.
Actualizado a mayo de 2026 — refleja la ola de lanzamientos de abril 2026 (DeepSeek V4, Qwen 3.6, Kimi K2.6).
Por qué solo modelos open-weights
Las APIs cerradas son fáciles. Pagas la cuenta, recibes la respuesta. La ingeniería interesante — y donde está la mayor parte de los malentendidos — está del lado de los pesos abiertos, donde realmente tienes que pensar en cantidad de parámetros, arquitectura MoE, cuantización, VRAM, y si tu Mac Studio realmente puede correr ese modelo de 1.6T que alguien tuiteó.
Esta guía cubre solo modelos de pesos abiertos. Todos los modelos descritos abajo se pueden descargar, correr en tu propio hardware, y enviar dentro de un producto sin pagar por token. El intercambio es que tienes que entender el hardware. De eso trata la mayor parte de esta guía.
Una nota sobre actualidad: la frontera de open-weights se mueve rápido — tres de los modelos más importantes en esta guía (DeepSeek V4, Qwen 3.6, Kimi K2.6) salieron dentro de una sola ventana de 30 días en abril 2026. Los números de versión específicos van a seguir cambiando. Los patrones arquitectónicos y el dimensionamiento de hardware no.
Parte 1 — Los modelos open-weights que importan en 2026
Hay aproximadamente 7 familias de modelos que vale la pena conocer para trabajo de producción real. Cualquier cosa que no esté en esta lista es un artefacto de investigación o una variante más pequeña de una de estas.
DeepSeek — Familia V4 (lanzada el 24 de abril de 2026)
DeepSeek V4 es la frontera actual de open-weights. Dos variantes lanzadas simultáneamente, ambas bajo licencia MIT, ambas con contexto de 1M de tokens. El cambio arquitectónico principal es la atención híbrida CSA + HCA (Compressed Sparse Attention + Heavily Compressed Attention), que reduce los FLOPs de inferencia a ~27% de V3.2 y la ocupación de KV cache a ~10% en contextos de 1M.
Tamaños que realmente usas:
- DeepSeek V4-Pro (MoE, 49B activos / 1.6T totales) — clase frontera, compite con Claude Opus y GPT-5 en programación y razonamiento.
- DeepSeek V4-Flash (MoE, 13B activos / 284B totales) — rápido, eficiente, ejecutable en una configuración multi-GPU que la mayoría de equipos pueden costear.
- DeepSeek R1 (aún mantenido, MoE 37B/671B) — predecesor afinado para razonamiento; sigue siendo relevante si ya estás desplegado con él o quieres una opción de razonamiento frontera más pequeña.
Licencia: MIT. Tan limpia como puede ser.
Casos de uso reales:
- «GPT-5 privado» auto-hospedado para una empresa regulada — un banco mexicano (Banorte, Banamex), una EPS colombiana, un hospital chileno, una fintech brasileña sujeta a LGPD, o una entidad gubernamental sujeta a soberanía de datos. V4-Pro sobre 8× H200 en un datacenter privado es la respuesta estándar en 2026 cuando no puedes mandar datos a APIs cerradas pero necesitas calidad frontera.
- Pipeline de revisión de código a alto volumen. V4-Flash procesa pull requests, code review, sugerencias de refactorización, herramientas de migración automatizada. Con 13B parámetros activos, el throughput por GPU es excelente y el costo por token es despreciable después del hardware.
- Análisis de documentos largos a escalas que hace seis meses solo eran posibles vía API. El contexto de 1M de V4 con el nuevo mecanismo de atención realmente funciona en rangos largos (el KV cache no explota). Útil para due diligence legal, revisión de literatura científica, análisis de bases de código completas.
- Inferencia barata vía la API de DeepSeek si no quieres auto-hospedar. V4-Flash a $0.14/M de tokens de entrada es ~18× más barato que el flagship de GPT-5 y suficientemente bueno para la mayoría del trabajo de producción.
- Base frontera para fine-tunes propietarios. La licencia MIT hace el fine-tuning comercial legalmente limpio — importante para SaaS verticales que quieren construir un modelo defendible sobre una base abierta.
Realidad de hardware: V4-Pro a precisión completa necesita un cluster de 8× H100/H200. V4-Flash entra cómodo en 2–4× H100 a FP8, o un Mac Studio de gama alta con cuantización fuerte para inferencia de un solo usuario. La mayoría de equipos van a usar V4-Pro vía API y auto-hospedar V4-Flash si necesitan control.
Moonshot — Kimi K2.6 (lanzado abril 2026)
Kimi K2.6 es el modelo open-weights más fuerte para programación a mediados de 2026 — top de cada benchmark relevante para tareas de programación autónoma de largo horizonte. INT4 QAT nativo (entrenamiento consciente de cuantización), lo que significa que está específicamente construido para correr cuantizado sin pérdida de calidad. Incluye capacidad de «agent swarm» — puede orquestar hasta 300 sub-agentes en paralelo.
Tamaños que realmente usas:
- Kimi K2.6 (MoE, 32B activos / 1T totales) — INT4 nativo, capacidad visual, contexto de 256K.
- Kimi K2.5 (predecesor) — aún ampliamente desplegado, más barato de hospedar.
Licencia: MIT Modificada (libre para casi todo uso comercial; atribución requerida arriba de 100M MAU o $20M de ingresos mensuales).
Casos de uso reales:
- Productos de programación agéntica en producción (alternativas open-source a Cursor / Devin). K2.6 es el modelo detrás de varios de estos en 2026. Economía competitiva contra APIs cerradas para startups de IA con respaldo VC.
- Code review y análisis de PR auto-hospedado sobre bases de código empresariales. La cuantización INT4 nativa es crítica aquí — obtienes calidad de programación frontera con materialmente menos hardware del que requiere V4-Pro.
- Tareas autónomas de largo horizonte — Moonshot demostró K2.6 ejecutando 4,000+ llamadas a herramientas a lo largo de 12+ horas para completar un proyecto real de ingeniería. Útil para trabajo agéntico nocturno por lotes (migraciones de bases de código, refactors a gran escala, generación de documentación).
- Bases de código políglotas (Rust + Go + Python + frontend + DevOps). K2.6 generaliza entre lenguajes mejor que la mayoría de modelos especializados en código, que tienden a ser muy enfocados en Python.
- Apps donde desplegar capacidad frontera de programación en tu propio hardware es ventaja competitiva — software de defensa, sistemas de trading financiero, firmware de dispositivos médicos. El código mismo es la propiedad intelectual y no puede salir del edificio.
Realidad de hardware: El INT4 nativo significa que K2.6 es genuinamente desplegable en 4× H100 o 2× H200, lo cual es mucho más accesible que V4-Pro. Cuantización fuerte corre en un Mac Studio de 256GB para inferencia de un solo usuario.
Alibaba — Familia Qwen 3.5 / 3.6
La familia abierta más completa. Cubre cada clase de tamaño desde sub-1B hasta flagships MoE de 1T. Qwen 3.5 (febrero 2026) fue el lanzamiento generacional principal; Qwen 3.6 (marzo-abril 2026) es el refresh enfocado en programación agéntica encima. Ambas líneas están activamente mantenidas.
Tamaños que realmente usas (mezcla Qwen 3.5 / 3.6):
- Qwen 3.5 4B / 9B / 27B (denso) — todoterreno fuertes. El 9B específicamente saca 81.7 en GPQA Diamond, sin precedente para modelos sub-30B.
- Qwen 3.6 27B (denso) — refresh del 27B con mejor programación agéntica.
- Qwen 3.6 35B-A3B (MoE, 3B activos / 35B totales) — el punto dulce de throughput de todo el ecosistema open en 2026. Calidad de 35B a velocidad de clase 3B.
- Qwen 3.5 122B-A10B (MoE, 10B activos / 122B totales) — corre en una Mac de 64GB.
- Qwen 3.5-397B-A17B flagship (MoE, 17B activos / 397B totales) — clase frontera.
- Qwen 3.6-Max-Preview — actualmente solo API, no open-weight; se menciona solo porque las derivadas open-weight de 3.6 fluyen de él.
Licencia: Apache 2.0 para tamaños hasta ~30B; personalizada (utilizable comercialmente) para los flagships más grandes.
Casos de uso reales:
- Soporte multilingüe para productos globales. Qwen maneja mandarín, japonés, coreano, indonesio, vietnamita, hindi, árabe, portugués (importante para operaciones que cubren Brasil) y español a calidad que Llama no puede igualar. La opción por defecto para cualquier producto LATAM con expansión a Asia.
- Backend de chat de alto throughput con presupuesto de latencia ajustado. Qwen 3.6 35B-A3B sirve 3–5× más usuarios concurrentes por GPU que alternativas densas de 30B porque solo 3B parámetros están activos por token. La mejor relación precio/desempeño para servir en producción en 2026.
- Programación agéntica local sobre Apple Silicon. Qwen 3.6 35B-A3B corre cómodo en una MacBook Pro M-series de 64GB vía MLX. Esta combinación (MLX + 35B-A3B MoE) se está volviendo el setup estándar para desarrolladores individuales.
- Despliegue on-prem para empresas con requerimientos de soberanía de datos — se puede correr completamente desconectado del internet, cumpliendo con regulaciones locales de protección de datos (LGPD en Brasil, Ley 1581 en Colombia, Ley 25.326 en Argentina, LFPDPPP en México).
- Base de fine-tuning para SaaS verticales. Los tamaños Qwen 3.5 4B–14B son las bases de fine-tuning más costo-efectivas del ecosistema — suficientemente pequeñas para fine-tunear en una sola GPU, suficientemente capaces para enviar a producción.
- Despliegue en edge. Los tamaños Qwen 3.5 0.8B y 2B corren en celulares y dispositivos IoT — útil para funciones de IA offline en apps móviles.
Meta — Familia Llama 4
La línea open más soportada del mundo. Cada framework de inferencia, librería de fine-tuning e integración de herramientas soporta Llama primero. Llama 4 introdujo MoE (Scout + Maverick) y multimodalidad nativa. Llama 3.3 70B sigue siendo el caballo de batalla denso; Llama 4 Behemoth (288B activos / ~2T totales) fue anunciado como modelo maestro pero no ha sido liberado como open-weights.
Tamaños que realmente usas:
- Llama 3.3 70B (denso) — sigue siendo el 70B abierto más desplegado en producción.
- Llama 4 Scout (MoE, 17B activos / 109B totales, 16 expertos) — entra en una sola H100 con cuantización INT4, contexto de 10M tokens.
- Llama 4 Maverick (MoE, 17B activos / 400B totales, 128 expertos) — entra en un solo host H100 DGX (8× H100), contexto 1M, multimodal nativo.
Licencia: Llama 4 Community License. Permisiva para la mayoría de usuarios; requiere licencia especial arriba de 700M MAU. No disponible para empresas domiciliadas en la UE a inicios de 2026 — esto es un detalle importante a verificar en la licencia actual antes de usar Llama 4 en cualquier despliegue cross-border desde LATAM.
Casos de uso reales:
- Asistente interno de empresa entrenado sobre tu wiki/documentación. Un fine-tune con LoRA de Llama 3.3 70B sobre documentación interna, servido vía vLLM en una sola H100, le da a cada empleado un equivalente privado de ChatGPT. El patrón de despliegue Llama más común en empresas medianas y grandes en LATAM.
- RAG multimodal sobre bibliotecas de documentos (PDFs con diagramas, formularios escaneados, gráficas). La comprensión de imágenes nativa de Llama 4 Scout + contexto de 10M maneja esto en un solo modelo. Caso típico: archivo histórico de actas notariales, expedientes médicos digitalizados, repositorios de diseño de ingeniería.
- Workflows de documentos largos — análisis de bases de código completas, procesamiento de documentos del tamaño de un libro, memoria conversacional de múltiples sesiones. El contexto de 10M de Scout es genuinamente útil aquí.
- SaaS multi-tenant donde necesitas auto-hospedar. Llama es la opción abierta más segura porque cada dependencia que necesitas (vLLM, TGI, Ollama, llama.cpp, MLX) lo soporta desde el día cero.
- Equipos de fine-tuning que necesitan máximo soporte de librerías. Llama es la base de fine-tuning más documentada y soportada del ecosistema.
Mistral
El laboratorio insignia europeo. Pragmático, bien licenciado, enfocado en código. Menos hype que DeepSeek o Kimi, más confiabilidad.
Tamaños que realmente usas:
- Mistral Small 3 (~24B denso) — eficiente, buena obediencia a instrucciones.
- Mistral Medium / Large 3 — flagships densos y MoE clase frontera.
- Codestral / Devstral — especializados en código; Devstral está afinado para programación agéntica multi-archivo.
- Magistral (~24B razonamiento) — modelo abierto de razonamiento.
Licencia: Apache 2.0 para la mayoría de releases.
Casos de uso reales:
- Chatbot on-prem cumpliendo con regulaciones de protección de datos — particularmente útil cuando el cliente requiere modelo de origen no-chino (algunos sectores en defensa, banca y gobierno tienen estos requisitos).
- Herramienta de programación agéntica que edita múltiples archivos. Devstral está hecho específicamente para esto — es el modelo detrás de varias alternativas open-source a Cursor.
- Backend de function-calling para features de producto. Los modelos Mistral son confiables para salida estructurada en JSON sin necesidad de prompting exótico. Común en features tipo «lenguaje natural → consulta estructurada».
- Procesamiento de documentos en español, portugués, francés donde Mistral tiene una ventaja medible sobre Qwen en variantes europeas del español.
- Asistente de programación local barato en una sola GPU. Devstral 24B en una GPU de 24GB corre cómodo y maneja tareas reales de refactorización.
Google — Familia Gemma
La respuesta abierta de Google a Llama y Qwen. Apache 2.0, tamaños desde ~1B hasta ~30B, con visión y tool calling en la última generación.
Tamaños que realmente usas:
- Gemma 4 9B — modelo pequeño fuerte con visión + tool calling.
- Gemma 4 27B — denso de tamaño medio; buena obediencia a instrucciones.
Licencia: Apache 2.0.
Casos de uso reales:
- Agente local con tool calling sobre hardware modesto. Gemma 4 9B en una GPU de 16GB maneja function calling de forma confiable — bueno para asistentes de escritorio, extensiones de navegador, automatización ligera.
- Pipeline de extracción de visión + texto sin pagar precios de API — leer screenshots, extraer datos de gráficas, procesar formularios escaneados (usos típicos: digitalización de archivos, automatización de back-office en aseguradoras).
- Despliegue en edge o on-device para apps móviles, kioscos, dispositivos industriales. Gemma es la familia abierta más optimizada para esto.
- Apps donde Apache 2.0 es legalmente requerida. Algunos procesos de procurement gubernamental y distribuciones OSS requieren específicamente una licencia aprobada por OSI. Gemma y Mistral son las opciones más limpias.
- Workloads sobre Google Cloud / Vertex AI donde Gemma tiene soporte de infraestructura de primera clase.
NVIDIA — Familia Nemotron
Los releases abiertos de NVIDIA, principalmente para mostrar lo que su stack de entrenamiento e inferencia puede hacer. Vale considerarlo si ya estás profundamente invertido en CUDA/TensorRT/NeMo.
Tamaños que realmente usas:
- Nemotron Nano (~4B–9B) — razonamiento eficiente.
- Nemotron Cascade / Ultra — variantes MoE más grandes afinadas para razonamiento.
Licencia: Varía por release; mayormente open-weight permisiva.
Casos de uso reales:
- Inferencia en producción exprimiendo cada token/seg de H100/H200/B200. Nemotron está co-diseñado con TensorRT-LLM y da throughput medible mejor que Llama/Qwen equivalente en el mismo hardware NVIDIA.
- Workloads de razonamiento sobre NVIDIA NIM microservices — si tu equipo de plataforma estandarizó en NIM, Nemotron es el camino de menor resistencia.
- Equipos de fine-tuning que ya usan NVIDIA NeMo. Quedarse dentro de un solo toolchain vale mucho operacionalmente.
Continúa con la segunda parte de este reportaje.








