Mixtral 8x22B: mixture of experts abierto y potente
Índice de contenidos
- Puntos clave
- Qué es Mixtral 8x22B
- Licencia y distribución
- Benchmarks clave
- Hardware requerido: el factor limitante
- Comparación con Mixtral 8x7B
- Serving en producción
- Coste de servir
- Casos de uso reales
- Conclusión
- Preguntas frecuentes
- ¿Puedo ejecutar Mixtral 8x22B en una RTX 4090 de 24 GB?
- ¿Cuándo compensa self-hostear Mixtral 8x22B frente a un servicio hosted?
- ¿Es Mixtral 8x22B mejor que Llama 3 70B?
- Fuentes
Mixtral 8x22B es el modelo Mixture of Experts de Mistral AI liberado en abril de 2024: 141B parámetros totales pero solo 39B activos por token, licencia Apache 2.0 sin restricciones comerciales y rendimiento multilingüe superior a Llama 3 70B en español, francés, italiano y alemán. Requiere GPU de datacenter para servirlo en producción real.
Mistral AI liberó Mixtral 8x22B el 10 de abril de 2024 con el estilo que ya les caracteriza: un magnet link en Twitter sin blog post previo ni conferencias. La comunidad descargó los pesos en horas y al día siguiente ya había benchmarks. Es la generación siguiente de su arquitectura MoE (Mixture of Experts), con 141B parámetros totales pero solo 39B activos por forward pass. Esto cambia la economía de servir modelos abiertos.
Puntos clave
-
La arquitectura MoE de Mixtral 8x22B activa solo 39B de sus 141B parámetros por token: capacidad de modelo grande con coste inferencial de modelo mediano.
-
Apache 2.0 sin restricciones comerciales: la opción más permisiva a gran escala, junto con Llama 3.
-
Multilingüe superior a Llama 3 70B, especialmente en español, francés, italiano y alemán.
-
El hardware mínimo es una A100 80 GB o H100 80 GB para servir cuantizado Q4, y con poco margen; una GPU consumer de 24 GB no llega.
-
Self-hosting compensa si procesas más de 100M tokens/mes sostenidamente; por debajo, los servicios hosted son más eficientes.
Qué es Mixtral 8x22B
La arquitectura Sparse Mixture of Experts:
-
8 "expertos" de 22B parámetros cada uno.
-
Router que elige 2 expertos por token.
-
Total: 141B parámetros en disco.
-
Activos por forward pass: ~39B (2 expertos + componentes compartidos).
El resultado: capacidad ~141B con coste inferencial ~39B. Mejor relación calidad/coste que un modelo denso equivalente.
Licencia y distribución
Apache 2.0. Sin restricciones de uso comercial. Mistral AI publicó primero el magnet link sin aviso previo y, una semana después, el anuncio oficial[1] junto con la versión instruct. Los pesos están disponibles en Hugging Face (base[2] e instruct[3]) y los magnet links originales siguen funcionando.
Comparado con Llama 3 70B (licencia más restrictiva) o Claude 3 (cerrado), Mixtral 8x22B es la opción más permisiva a gran escala para uso comercial sin umbrales de usuarios.
Benchmarks clave
| Benchmark | Mixtral 8x22B | Llama 3 70B | GPT-4 | GPT-3.5 |
|---|---|---|---|---|
| MMLU | 77.8 | 79.5 | 86.4 | 70.0 |
| HellaSwag | 88.9 | 88.0 | 95.3 | 85.5 |
| GSM8K | 78.6 | 93.0 | 92.0 | 57.1 |
| HumanEval | 45.1 | 81.7 | 88.4 | 48.1 |
| Multilingüe (FR, ES, IT, DE) | Excelente | Bueno | Excelente | Medio |
Los números varían algo según el harness de evaluación usado por cada laboratorio; los de esta tabla proceden de comparativas públicas agregadas tras el lanzamiento y del anuncio oficial de Mistral AI[1].
Puntos clave:
-
Calidad general cercana a Llama 3 70B con arquitectura más eficiente inferencialmente.
-
Multilingüe superior: especialmente para casos de negocio en español, francés, italiano y alemán.
-
Queda por detrás en matemáticas vs Llama 3 70B y en coding vs Claude 3 Opus.
-
Para casos multilingües europeos, Mixtral 8x22B es probablemente la mejor opción abierta disponible.
Hardware requerido: el factor limitante
| Precisión | Memoria VRAM |
|---|---|
| FP16 | ~280 GB |
| INT8 | ~140 GB |
| INT4 (GGUF Q4_K_M) | ~80 GB |
| INT3 | ~60 GB |
Implicaciones prácticas:
-
No cabe en una GPU consumer: una 4090 (24 GB) no llega ni cuantizada.
-
Una sola A100 80 GB o H100 80 GB está en el límite justo de INT4: carga el modelo pero deja poco margen para contexto y batching. En la práctica, 2× A100/H100 80 GB da margen real.
-
2× A100 40 GB distribuido con tensor parallelism funciona.
-
Apple Silicon M3 Max 128 GB: según reportes de la comunidad, corre Q4 a ~5-10 tokens/s.
Para producción seria, casi siempre necesitas GPU de datacenter.
Comparación con Mixtral 8x7B
El hermano menor (46.7B total, 12.9B activos):
| Aspecto | 8x7B | 8x22B |
|---|---|---|
| Parámetros totales | 46.7B | 141B |
| Activos/token | 12.9B | 39B |
| VRAM Q4 | ~25 GB | ~80 GB |
| Calidad general | ~GPT-3.5 | Entre GPT-3.5 y GPT-4 |
| Multilingüe | Muy bueno | Excelente |
| Tokens/s (A100 Q4) | ~60 | ~25 |
Salvo que necesites el techo de calidad, 8x7B es más pragmático: más rápido, más barato, calidad suficiente. El 8x22B tiene sentido cuando la calidad importa más que el throughput. Ambos son buenas bases para cuantización con llama.cpp en despliegues edge.
Serving en producción
Con vLLM[4]:
python -m vllm.entrypoints.openai.api_server
--model mistralai/Mixtral-8x22B-Instruct-v0.1
--tensor-parallel-size 2
--gpu-memory-utilization 0.9
--max-model-len 32768
Con llama.cpp[5] para Q4:
./server -m mixtral-8x22b-instruct-Q4_K_M.gguf
-c 16384 -ngl 99 --host 0.0.0.0 --port 8080
vLLM ofrece mejor throughput en GPU. llama.cpp es más portable y maneja offload CPU-GPU mixto.
Coste de servir
-
1× A100 80 GB on-prem: unos $15k/año amortizado.
-
AWS p4d.24xlarge (8× A100 40 GB): entre $22 y $33/hora según región y compromiso (precios de la instancia P4[6]), es decir, entre $16k y $24k al mes.
-
Together.ai hosted[7]: $1.20 por millón de tokens de entrada y salida.
Self-hosting compensa si procesas más de 100M tokens/mes sostenidamente. Por debajo, los servicios hosted como Together.ai, Anyscale o Mistral La Plateforme son más eficientes.
Casos de uso reales
Mixtral 8x22B brilla en:
-
Multilingüe empresarial: documentos en ES/FR/IT/DE/EN.
-
RAG con contexto largo (ventana nativa de 64k tokens).
-
Summarización y análisis complejos.
-
Self-hosting con compliance estricto: sin datos saliendo a la nube.
Otros modelos ganan en:
-
Matemáticas: Llama 3 70B o Claude 3 Opus.
-
Coding top-tier: Claude 3 Opus, DeepSeek Coder.
-
Ultra-long context: Gemini 1.5.
Conclusión
Mixtral 8x22B confirma que Mistral AI lidera la frontera abierta en Europa. Su arquitectura MoE equilibra calidad y eficiencia inferencial de forma atractiva. Para equipos que pueden permitirse el hardware, es la mejor opción abierta para casos multilingües serios.
Para quienes no, Mixtral 8x7B sigue siendo válido como opción más ligera. Y para producción seria sin GPU propia, los servicios hosted ofrecen acceso pay-per-token. El ecosistema abierto continúa cerrando la brecha con los frontier models cerrados, un complemento natural a la familia Claude 3 para organizaciones que quieren alternativa multilingüe de código abierto.
Lee también la versión en inglés: Mixtral 8x22B: Open and Powerful Mixture of Experts.
Preguntas frecuentes
¿Puedo ejecutar Mixtral 8x22B en una RTX 4090 de 24 GB?
No, ni cuantizado: en INT4 (GGUF Q4_K_M) el modelo necesita unos 80 GB de VRAM, y en INT3 unos 60 GB. Una sola A100 80 GB o H100 80 GB está en el límite justo: carga el modelo pero deja poco margen para contexto y batching. En la práctica, 2× A100/H100 80 GB da margen real, y 2× A100 40 GB con tensor parallelism también funciona. Si solo tienes una GPU consumer, Mixtral 8x7B cabe en unos 25 GB en Q4.
¿Cuándo compensa self-hostear Mixtral 8x22B frente a un servicio hosted?
Cuando procesas más de 100M tokens al mes de forma sostenida. Por debajo, servicios como Together.ai, Anyscale o Mistral La Plateforme son más eficientes: Together.ai cobra $1,20 por millón de tokens de entrada y salida. Como referencia de coste propio, una A100 80 GB on-prem sale a unos $15k al año amortizada. Una AWS p4d.24xlarge con 8× A100 40 GB cuesta entre $22 y $33 por hora según región y compromiso, es decir, entre $16k y $24k al mes.
¿Es Mixtral 8x22B mejor que Llama 3 70B?
Depende de la tarea: Mixtral 8x22B gana en multilingüe, especialmente en español, francés, italiano y alemán, con una licencia Apache 2.0 más permisiva y una ventana nativa de 64k tokens. Llama 3 70B lo supera en matemáticas (93,0 frente a 78,6 en GSM8K) y en coding (81,7 frente a 45,1 en HumanEval). En MMLU queda ligeramente por delante, con 79,5 frente a 77,8. Para casos multilingües europeos, Mixtral es probablemente la mejor opción abierta.