Qué es oMLX y en qué se diferencia de MLX, Ollama y LM Studio
Índice de contenidos
- Puntos clave
- Qué es oMLX exactamente
- oMLX no es MLX
- Cómo funciona por dentro
- Comparado con Ollama, LM Studio y llama.cpp
- Por qué no hay versión para Windows, Linux ni Docker
- Para quién tiene sentido
- Preguntas frecuentes
- ¿oMLX y MLX son lo mismo?
- ¿Puedo instalar oMLX en Windows o en Linux?
- ¿Qué modelos admite oMLX?
- Conclusión
- Fuentes
oMLX es un servidor de inferencia local para Mac con Apple Silicon que envuelve el framework MLX de Apple en un proceso web y lo expone con las API de OpenAI y de Anthropic. Añade lotes continuos, caché KV en disco y varios modelos en memoria a la vez, gobernados desde la barra de menús.
oMLX es un servidor de inferencia local para Mac con Apple Silicon que convierte el framework MLX de Apple en un servicio permanente con las API que ya usan tus herramientas. La confusión más habitual es tomarlo por el framework de Apple, del que solo se diferencia una letra. Este artículo aclara qué es cada cosa, cómo se compara con Ollama y LM Studio, y por qué no existe versión para Windows ni para Linux.
Puntos clave
- oMLX es un servidor, no un framework. Envuelve MLX, que es la biblioteca de cálculo de Apple, en un proceso FastAPI con endpoints web.
- Es una aplicación nativa de macOS escrita en Swift y SwiftUI, gobernada desde la barra de menús, con licencia Apache 2.0.
- Su diferencia técnica frente a alternativas es la caché KV por niveles: bloques calientes en RAM y bloques fríos en SSD que sobreviven a los reinicios.
- Mantiene varios modelos cargados a la vez y expulsa el menos usado cuando falta memoria, con un techo por defecto de la RAM del sistema menos 8 GB.
- Solo funciona en Apple Silicon con macOS 15 o superior. No hay versión para Windows, Linux ni Docker, y no la habrá por cómo está construido MLX.
Qué es oMLX exactamente
oMLX es un servidor de inferencia de modelos de lenguaje que se ejecuta en tu Mac y expone esos modelos por HTTP. La descripción del propio proyecto lo resume así: un servidor de inferencia con lotes continuos y caché en SSD para Apple Silicon, gobernado desde la barra de menús de macOS.
Por dentro es un proceso FastAPI que envuelve MLX, el framework de aprendizaje automático que Apple publicó para sus chips de la serie M. Sobre esa base añade tres cosas que MLX no trae: un grupo de motores que mantiene varios modelos en memoria y expulsa el menos usado cuando hace falta sitio, una caché de claves y valores repartida entre RAM y SSD, y un conjunto de endpoints que imitan las API de OpenAI y de Anthropic.
Se publica bajo licencia Apache 2.0 en el repositorio jundot/omlx. La versión actual es la 0.6.4, del 29 de agosto de 2026, y el ritmo de publicación es alto: entre el 18 y el 29 de agosto salieron seis versiones.
La aplicación es nativa, escrita en Swift y SwiftUI, no un envoltorio de navegador. Vive en la barra de menús, arranca y detiene el servidor, conserva estadísticas entre reinicios y se actualiza sola.
oMLX no es MLX
Esta es la distinción que más búsquedas genera y merece una respuesta directa.
MLX es el framework de Apple: una biblioteca de cálculo con matrices, diseñada para la memoria unificada de los chips de la serie M, con una API parecida a la de NumPy y PyTorch. Es la capa que ejecuta las operaciones matemáticas. Por sí sola no sirve modelos ni entiende de HTTP.
mlx-lm es la capa de encima: carga modelos de lenguaje, los ejecuta y genera texto. Es lo que usas si escribes un guion de Python.
oMLX es la capa de servicio: coge mlx-lm, lo mete en un proceso que escucha en un puerto, gestiona la memoria entre varios modelos y habla los protocolos que tus clientes ya conocen. Es la diferencia entre tener una biblioteca y tener un servicio.
Dicho de otra forma: MLX ejecuta el modelo, oMLX decide qué modelo está cargado, cuánta memoria ocupa, quién puede llamarlo y en qué formato.
Cómo funciona por dentro
Tres piezas explican casi todo su comportamiento.
El grupo de motores gestiona el ciclo de vida de los modelos de lenguaje, de visión, de embeddings y de los reordenadores. Aplica expulsión por menos usado recientemente, permite fijar modelos para que nunca se descarguen y admite un tiempo de vida por modelo que lo libera tras un periodo inactivo. Un vigilante de memoria impone el techo total, que por defecto es la RAM del sistema menos 8 GB, pensado para que el Mac entero no se quede sin memoria.
La caché de claves y valores por niveles es su rasgo distintivo. Funciona por bloques, con prefijos compartidos, copia al escribir y expulsión por menos usado, un diseño tomado de vLLM. Los bloques calientes viven en RAM; cuando esta se llena, los fríos se vuelcan al SSD en formato safetensors. Si vuelves a mandar una petición con el mismo prefijo, los bloques se recuperan del disco en lugar de recalcularse, y eso sigue funcionando después de reiniciar el servidor. Sobre esa base, TurboQuant cuantiza la caché con un códec de error cuadrático medio y reduce su tamaño entre un 60 % y un 75 %.
Los lotes continuos permiten atender peticiones simultáneas sin esperar a que termine la anterior, mediante el generador por lotes de mlx-lm. El límite viene fijado en ocho peticiones concurrentes y se puede cambiar.
Comparado con Ollama, LM Studio y llama.cpp
Las cuatro herramientas resuelven el mismo problema con prioridades distintas:
| oMLX | Ollama | LM Studio | llama.cpp | |
|---|---|---|---|---|
| Plataformas | Solo macOS con Apple Silicon | macOS, Linux, Windows | macOS, Linux, Windows | Casi todas |
| Motor de cálculo | MLX de Apple | llama.cpp | llama.cpp y MLX | Propio |
| Formato de modelo | MLX | GGUF | GGUF y MLX | GGUF |
| Interfaz principal | Barra de menús y panel web | Línea de comandos | Aplicación de escritorio | Línea de comandos |
| Varios modelos en memoria | Sí, con expulsión y fijado | Limitado | Limitado | Manual |
| Caché KV en disco | Sí, persiste entre reinicios | No | No | Parcial |
| API de Anthropic | Sí | No | No | No |
La lectura práctica es sencilla. Si trabajas en varias máquinas o en Linux, Ollama es la elección obvia y ya escribí sobre cómo instalarlo en un Mac. Si quieres una aplicación de escritorio con la que explorar modelos, LM Studio cubre ese hueco. Si te interesa exprimir el rendimiento a mano, las optimizaciones de llama.cpp van más lejos.
oMLX gana cuando la máquina es un Mac con bastante memoria y quieres tratarla como un servidor: varios modelos vivos, peticiones concurrentes, caché que sobrevive a los reinicios y clientes que hablan tanto el dialecto de OpenAI como el de Anthropic. Ese último punto es el que lo hace atractivo para quien usa Claude Code, porque el cliente apunta al Mac sin traducciones intermedias.
Por qué no hay versión para Windows, Linux ni Docker
La respuesta corta es que oMLX es MLX, y MLX es de Apple.
MLX está construido sobre la memoria unificada y el motor Metal de los chips de la serie M. No es una capa de compatibilidad que se pueda recompilar: el modelo de memoria que lo hace rápido, en el que el procesador y la unidad gráfica comparten el mismo espacio sin copias, no existe en un PC con una tarjeta gráfica dedicada.
De ahí salen los requisitos, que la fórmula de Homebrew comprueba y hace cumplir: macOS 15 o superior, Python entre la 3.11 y la 3.13, y un chip Apple Silicon de la serie M1 a M5. Un Mac con Intel se rechaza durante la instalación.
Tampoco hay imagen de Docker, y por el mismo motivo: un contenedor en macOS corre dentro de una máquina virtual Linux que no tiene acceso a Metal. Meter oMLX en un contenedor lo dejaría sin la aceleración que justifica su existencia.
Si tu hardware no es un Mac con chip de la serie M, la pregunta no es cómo instalar oMLX sino qué usar en su lugar, y la respuesta suele ser Ollama o llama.cpp.
Para quién tiene sentido
Tiene sentido si tienes un Mac con Apple Silicon y bastante memoria unificada, y quieres que actúe como servidor de modelos para varias herramientas a la vez. El caso que mejor lo justifica es el de quien usa un asistente de programación y quiere que hable con un modelo local sin renunciar al cliente que ya conoce.
No tiene sentido si solo quieres probar un modelo de vez en cuando, porque Ollama o LM Studio te dan eso con menos piezas. Tampoco si necesitas la misma configuración en Linux, ni si tu Mac tiene 16 GB, donde el techo de memoria deja poco margen después de restar los 8 GB de reserva.
Y conviene tenerlo presente: el proyecto es joven y avanza rápido, con varias versiones al mes que tocan el motor de inferencia. Eso es bueno para el rendimiento y menos bueno para la estabilidad. Trátalo como una herramienta de trabajo que actualizas leyendo las notas, no como una pieza que instalas y olvidas.
Preguntas frecuentes
¿oMLX y MLX son lo mismo?
No. MLX es el framework de cálculo de Apple para sus chips de la serie M, la capa que ejecuta las operaciones. oMLX es un servidor independiente, del desarrollador jundot, que envuelve MLX y lo expone por HTTP con las API de OpenAI y de Anthropic, añadiendo gestión de memoria, caché en disco y varios modelos cargados a la vez.
¿Puedo instalar oMLX en Windows o en Linux?
No, y no está previsto. oMLX depende del framework MLX de Apple, que se apoya en la memoria unificada y en Metal de los chips de la serie M. Los requisitos son macOS 15 o superior, Python entre la 3.11 y la 3.13 y un chip Apple Silicon. En otras plataformas la alternativa equivalente es Ollama o llama.cpp.
¿Qué modelos admite oMLX?
Cualquier modelo de lenguaje del catálogo de mlx-lm; modelos de visión como la serie Qwen3.5, GLM-4V y Pixtral; modelos de reconocimiento de texto como DeepSeek-OCR, DOTS-OCR y GLM-OCR, que detecta automáticamente; modelos de embeddings como BERT, BGE-M3 y ModernBERT; y reordenadores basados en ModernBERT y XLM-RoBERTa.
Conclusión
oMLX ocupa un hueco bastante estrecho y lo ocupa bien: convertir un Mac con memoria de sobra en un servidor de modelos serio, con varios cargados a la vez, caché que persiste y compatibilidad con los dos formatos de API que domina el mercado. Esa estrechez es deliberada, y explica tanto lo que hace bien como por qué nunca saldrá de macOS.
Si te encaja, el siguiente paso es instalarlo: la vía de Homebrew está en instalar, actualizar y desinstalar oMLX, y la configuración del servidor en la guía de la API y el puerto. La versión inglesa de este artículo está en What is oMLX and how it differs from MLX, Ollama and LM Studio.
Fuentes
Código fuente
Accede a todo el código fuente de este artículo en GitHub.
Ver en GitHub