Qué modelos abiertos de agosto de 2026 merece la pena ejecutar en tu equipo
Índice de contenidos
- Puntos clave
- Qué cubre este repaso y qué no
- Qué se publicó de verdad con pesos descargables
- Los nombres que circulan sin pesos detrás
- Qué permite de verdad cada licencia
- Muse Glimmer y el límite de los 24 GB
- Qué elegir según la memoria que tengas
- Qué hacer con la rueda de las actualizaciones
- Preguntas frecuentes
- ¿Cómo compruebo yo mismo si un modelo tiene pesos abiertos?
- ¿Merece la pena Nemotron 3.5 Lightning con 24 GB?
- ¿Un modelo con pesos abiertos se puede usar en un producto de pago?
- Conclusión
- Fuentes
Agosto de 2026 dejó una decena de modelos con pesos realmente descargables, y también varios nombres que solo existen como API alojada. Los que cambian lo que cabe en un equipo propio son Muse Glimmer 30B y Qwen3.8-27B, ambos con licencia Apache 2.0, más Ling-3.0-tiny para máquinas pequeñas.
Agosto de 2026 ha dejado más pesos abiertos de los que caben en una tarjeta gráfica. El problema no es la cantidad. Es que buena parte de los nombres que circulan en los resúmenes del mes no tiene pesos descargables: son servicios de API con aire de modelo abierto. Este repaso separa una cosa de la otra, dice qué licencia lleva cada modelo y cuánta memoria pide de verdad.
Puntos clave
- El lanzamiento que más cambia lo que cabe en un equipo doméstico es Muse Glimmer 30B, de Meta Superintelligence Lab, con licencia Apache 2.0 y diseñado desde el principio para caber en 24 GB.
- Qwen3.8-27B es el otro lanzamiento redondo del mes: 27.000 millones de parámetros densos, comprensión de imagen y vídeo, y Apache 2.0 sin letra pequeña.
- Muse Spark 1.2 no tiene pesos publicados. Meta anunció el 10 de agosto que los abriría; a 30 de agosto seguían sin aparecer.
- GLM-5.2 Turbo, Seed 2.1 Turbo y DeepSeek V4 Flash Vision Exp existen solo como API: ninguno tiene repositorio en la organización de su propio fabricante.
- Qwen3.8-Max no es un modelo cerrado. Es el nombre comercial del alojado Qwen3.8-2.4T-A95B, cuyos pesos sí están publicados, aunque con 2,4 billones de parámetros no los vas a ejecutar en casa.
Qué cubre este repaso y qué no
Cubre lo publicado entre el 1 y el 30 de agosto de 2026, y está escrito el 30 de agosto de 2026. Todo lo que aparece aquí se comprobó ese día abriendo el repositorio del fabricante, leyendo la ficha del modelo y el fichero de licencia. Ningún dato viene de un resumen ajeno.
Conviene decirlo porque un artículo con fecha en el título envejece rápido. Dentro de tres meses habrá modelos mejores y alguna de estas licencias se habrá revisado. Lo que no va a envejecer es el método: antes de creerte que un modelo es abierto, busca su repositorio en la organización oficial del fabricante. Si no está ahí, no hay pesos.
Qué se publicó de verdad con pesos descargables
Estos son los modelos de agosto cuyos pesos se pueden descargar hoy. La columna de memoria es el tamaño real de la descarga cuantizada, no el número de parámetros:
| Modelo | Fecha | Parámetros | Licencia | ¿Cabe en un equipo propio? |
|---|---|---|---|---|
| Muse Glimmer 30B | 9 ago | 29.600 M densos | Apache 2.0 | Sí, 17 GB con la cuantización oficial |
| Qwen3.8-27B | 5 ago | 27.800 M densos | Apache 2.0 | Sí, 18 GB en q4 |
| Granite 4.2 (3B / 8B / 30B) | 7 ago | 3.660 / 8.790 / 29.280 M | Apache 2.0 | Sí, desde 2,2 GB |
| Ling-3.0-tiny | 10 ago | 7.900 M totales, 1.300 M activos | MIT | Sí, 8,34 GiB en FP8 |
| LFM2.5-VL-3B | 11 ago | 3.120 M | LFM Open License 1.0 | Sí |
| Nemotron 3.5 Lightning | 1 ago | 31.600 M totales, 3.000 M activos | OpenMDW 1.1 | Justo, 25 GB |
| GLM-5.3-Flash | 25 ago | 320.000 M totales, 18.000 M activos | MIT | No, servidor |
| Qwen3.8-Flash-Next | 24 ago | 180.000 M | Qwen Community 1.0 | No |
| Qwen3.8-2.4T-A95B | 8 ago | 2,4 billones, 95.000 M activos | Qwen3.8-Max | No |
| DeepSeek V4-Pro-0813 | 13 ago | 1,65 billones | MIT | No |
| Hy4-preview (Tencent) | 27 ago | 780.000 M | Apache 2.0 | No |
Las cinco primeras filas son las que le importan a alguien con una tarjeta de consumo delante. El resto son pesos abiertos de verdad, con licencias serias, que necesitan un armario de servidores para arrancar.
Los nombres que circulan sin pesos detrás
Aquí está el valor de comprobarlo uno mismo. Cuatro de los nombres más repetidos del mes no son pesos abiertos:
Muse Spark 1.2 es el caso más confuso. Meta anunció el 10 de agosto que abriría sus pesos, un giro respecto a las tres versiones anteriores de Muse Spark, que fueron cerradas. Una promesa no es un fichero: a 30 de agosto no existe ningún repositorio de Muse Spark en Hugging Face. Lo que Meta sí publicó, el 9 de agosto, fue Muse Glimmer 30B, un modelo destilado de Muse Spark y con licencia Apache 2.0. Si has leído que "Meta abrió Muse Spark 1.2", el modelo que puedes descargar hoy se llama Glimmer.
GLM-5.2 Turbo, Seed 2.1 Turbo y DeepSeek V4 Flash Vision Exp aparecen en las listas del mes con precio por millón de tokens, que es justamente la pista. Ninguno tiene repositorio en zai-org, ByteDance-Seed ni deepseek-ai. Son variantes alojadas. Y dos correcciones de fecha que se repiten mucho: GLM-5.2 es de junio, no de agosto, y DeepSeek V4-Flash es del 31 de julio.
Qwen3.8-Max merece un matiz distinto, porque no es un cierre sino una confusión de nombres. La ficha de Qwen3.8-2.4T-A95B lo dice sin rodeos: "Qwen3.8-Max is the official version based on Qwen3.8-2.4T-A95B with more features, such as vision input & non-thinking support, 1M context length by default, official built-in tools". Es decir, Max es el servicio; los pesos de ese mismo modelo están publicados. La ficha añade una frase que sí es noticia: "For the first time, Qwen3.8 brings a Qwen-Max-class model to open release".
Sobre el recuento de "catorce modelos nuevos en agosto" que circula por ahí: no he encontrado ninguna fuente primaria que lo sostenga, así que no lo repito. Los que he podido verificar uno a uno son los once de la tabla anterior.
Qué permite de verdad cada licencia
Que un modelo tenga pesos descargables no significa que puedas venderlo. Merece la pena leer las licencias porque las diferencias son grandes:
- Apache 2.0 (Muse Glimmer, Qwen3.8-27B, Granite 4.2, Hy4) y MIT (GLM-5.3-Flash, Ling-3.0, DeepSeek V4-Pro): uso comercial sin condiciones. Son las limpias.
- Licencia Qwen3.8-Max: gratuita, pero obliga a mostrar el nombre del modelo en tu interfaz si superas los 100 millones de usuarios mensuales o 20 millones de dólares de facturación mensual, y exige una licencia aparte si tienes un negocio de modelo como servicio con más de 50 millones de dólares en doce meses.
- Qwen Community License 1.0 (Qwen3.8-Flash-Next): la misma idea, pero la segunda cláusula no tiene umbral. Cualquier negocio de modelo como servicio necesita permiso, factures lo que factures. Curiosamente es más estricta que la del modelo grande.
- Licencia GLM-5.3: solo pide una revisión de seguridad a quien facture más de 10.000 millones de dólares. Para el resto del mundo es permisiva.
- LFM Open License 1.0 (Liquid AI): deriva de Apache, pero su sección 5 condiciona el uso comercial a no superar un umbral de 10 millones de dólares anuales. Por encima de esa cifra el uso comercial, en palabras de la propia licencia, "is not licensed under this Agreement". Es la más restrictiva del repaso.
- OpenMDW 1.1 (Nemotron 3.5 Lightning), la licencia de NVIDIA para pesos y datos, con texto público[1].
Ninguno de estos modelos es software libre en sentido estricto: ninguno publicó sus datos de entrenamiento. "Pesos abiertos" y "código abierto" siguen siendo cosas distintas.
Muse Glimmer y el límite de los 24 GB
De todo lo de agosto, este es el lanzamiento que cambia el cálculo. Muse Glimmer tiene 29.600 millones de parámetros, de los cuales unos 1.800 millones son un codificador de percepción ViT-G/14 que le permite leer capturas de pantalla, gráficas y documentos. Contexto de 131.072 tokens, más de cien idiomas, y conocimiento hasta el 4 de enero de 2026.
Lo interesante es que Meta lo diseñó para entrar en una tarjeta de consumo. Su ficha lo explica así: "We use quantization techniques to compress the model’s weights to approximately 4-bit precision, shrinking the language model to under 20 GB. This leaves enough headroom for the model’s KV cache, the perception encoder for image understanding, and the speculative decoding drafter to run simultaneously within a 24 GB or 32 GB envelope".
Y aportan la medida de la degradación, que es lo que casi nadie publica. La variante de 17 GB, pensada para 24 GB de memoria, pierde un 1,0 % de media en quince pruebas; la variante dinámica para 32 GB pierde un 0,2 %. Si vienes de pelearte con la cuantización de modelos y llama.cpp, sabrás lo raro que es que un fabricante ponga ese número por escrito.
El modelo viene además con un borrador de decodificación especulativa que propone bloques de dieciséis tokens de golpe. Las cifras medidas por Meta, con lote de tamaño uno y decodificación voraz:
| Equipo | Sin especulación | Con especulación | Mejora |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 tokens/s | 233,4 tokens/s | 3,1x |
| Apple M4 Max | 23,7 tokens/s | 37,8 tokens/s | 1,5x |
| Apple M5 Max | 26,6 tokens/s | 50,2 tokens/s | 1,8x |
Un 5090 generando 233 tokens por segundo con un modelo de treinta mil millones de parámetros y visión es algo que hace un año pedía una máquina alquilada.
Qué elegir según la memoria que tengas
La cifra que manda no es el número de parámetros, es cuánta memoria ocupa el fichero cuantizado más su caché de contexto. Con eso en mente:
8 GB de VRAM. Granite 4.2 3B ocupa 2,2 GB y Granite 4.2 8B en q4 se queda en 5,1 GB, ambos con Apache 2.0 y 128K de contexto nativo. Es el tramo donde una licencia limpia importa más, porque suele ser hardware de aprendizaje o de un proyecto pequeño que quizá crezca.
16 GB de VRAM. Aquí entra Ling-3.0-tiny, que es mi recomendación del mes por relación entre potencia y consumo: 7.900 millones de parámetros totales pero solo 1.300 millones activos por token, con licencia MIT y un pico de memoria de 8,34 GiB a 8K de contexto. Deja sitio de sobra para un contexto largo. Para tareas con imágenes, LFM2.5-VL-3B cabe holgadamente, con la salvedad de su licencia.
24 GB de VRAM. El tramo de Muse Glimmer con su cuantización de 17 GB, y de Qwen3.8-27B, que en q4 y en formato NVFP4 se queda en 18 GB. Granite 4.2 30B también entra en 18 GB. Si tu trabajo es agéntico y con capturas de pantalla, Glimmer; si necesitas contexto enorme, Qwen3.8-27B arranca en 262.144 tokens y estira hasta el millón.
Apple Silicon con memoria unificada. El reparto es más generoso porque la memoria se comparte, pero el ancho de banda manda en la velocidad. Ling-3.0-tiny alcanza entre 86 y 90 tokens por segundo en un MacBook M4 Pro. Muse Glimmer se queda en 37,8 en un M4 Max y en 50,2 en un M5 Max, cifras usables para conversar pero no para procesar por lotes. Si vas por esta vía, la guía de instalación de Ollama en macOS te ahorra la primera tarde.
Casi todo esto se descarga con una orden:
ollama pull granite4.2:3b # 2,2 GB, tramo de 8 GB
ollama pull granite4.2:8b # 5,3 GB, tramo de 8 GB
ollama pull qwen3.8:27b-nvfp4 # 18 GB, tramo de 24 GB
ollama pull granite4.2:30b # 18 GB, tramo de 24 GB
ollama pull nemotron-3.5-lightning:30b-a3b # 25 GB, pide 32 GB
Si es tu primera vez, empieza por la instalación de Ollama. Y antes de elegir modelo para un agente, comprueba cuáles manejan bien las llamadas a herramientas, porque en eso las diferencias entre estos once son mayores que en cualquier prueba de conocimiento general.
Qué hacer con la rueda de las actualizaciones
Once modelos en un mes marean, y ese mareo tiene un coste: cada cambio de modelo obliga a repasar los prompts, las herramientas y las evaluaciones. Mi postura después de este repaso es poco heroica.
Cambia de modelo cuando se rompa un límite duro, no cuando suba un punto en una tabla. Un límite duro es que ahora cabe en tu tarjeta algo que antes no cabía, que aparece una capacidad que no tenías (visión, contexto de un millón, llamadas a herramientas fiables), o que una licencia deja de servirte. Agosto ofrece dos de esos saltos reales: un modelo multimodal agéntico de treinta mil millones de parámetros en 24 GB, y un modelo de razonamiento MIT que corre a 90 tokens por segundo en un portátil.
Lo demás es ruido de versiones. Y una nota práctica: fija la versión del modelo en tu configuración. Las etiquetas de Ollama se recortan y se rehacen, y descubrir que tu agente cambió de cuantización de un día para otro es una tarde perdida. Si te interesa el detalle del formato, está en Gemma 4 ejecutado con Ollama.
Preguntas frecuentes
¿Cómo compruebo yo mismo si un modelo tiene pesos abiertos?
Busca el repositorio en la organización oficial del fabricante en Hugging Face, no en el buscador general. Si el único resultado es una copia de un tercero, no hay publicación oficial. Después abre el fichero LICENSE del repositorio, porque la etiqueta que muestra la web dice a veces "other" y esconde condiciones de facturación.
¿Merece la pena Nemotron 3.5 Lightning con 24 GB?
Va justo. Son 31.600 millones de parámetros totales con solo 3.000 millones activos, así que genera rápido, pero la descarga son 25 GB y hay que tener los pesos completos en memoria. Con 32 GB va cómodo; con 24 GB tendrás que recortar contexto y aun así irás apurado.
¿Un modelo con pesos abiertos se puede usar en un producto de pago?
Depende de la licencia, y en agosto la horquilla es amplia. Con Apache 2.0 o MIT, sí y sin condiciones. Con la LFM Open License, solo mientras factures menos de 10 millones de dólares al año. Con las licencias de Qwen puedes vender producto, pero ofrecer el modelo como servicio a terceros exige permiso aparte.
Conclusión
Agosto de 2026 ha sido un mes bueno para quien ejecuta modelos en su propia máquina, aunque no exactamente por los motivos que cuentan los resúmenes. El titular no es el modelo de 2,4 billones de parámetros: es que Meta publicó bajo Apache 2.0 un modelo multimodal y agéntico de treinta mil millones de parámetros medido a 233 tokens por segundo en una tarjeta de consumo, y que un MoE de licencia MIT da respuestas razonadas a 90 tokens por segundo en un portátil. Lo otro que deja el mes es un recordatorio barato: comprueba el repositorio antes de creerte la palabra "abierto". La versión en inglés de este artículo está en Which open models of August 2026 are worth running.
Fuentes
- texto público
- Meta Superintelligence Lab, ficha del modelo Muse Glimmer 30B
- Qwen, ficha de Qwen3.8-27B
- Qwen, ficha y licencia de Qwen3.8-2.4T-A95B
- Z.AI, ficha de GLM-5.3-Flash
- IBM, ficha de Granite 4.2 8B
- inclusionAI, ficha de Ling-3.0-tiny
- NVIDIA, ficha de Nemotron 3.5 Lightning 30B-A3B
- Liquid AI, LFM2.5-2.6B y la LFM Open License 1.0
- Ollama, biblioteca del modelo qwen3.8