oMLX trae un banco de pruebas en el panel que mide tiempo hasta el primer token, tiempo por token, tokens por segundo y pico de memoria, con prompts de 1.024 a 200.000 tokens. El techo de memoria por defecto es la RAM del sistema menos 8 GB, y es lo que decide qué contexto cabe.
oMLX es un servidor de inferencia local para Mac con Apple Silicon que envuelve el framework MLX de Apple en un proceso web y lo expone con las API de OpenAI y de Anthropic. Añade lotes continuos, caché KV en disco y varios modelos en memoria a la vez, gobernados desde la barra de menús.
El panel de oMLX vive en localhost:8000/admin y reúne monitorización, carga y descarga de modelos, chat con historial, descargador de Hugging Face, benchmarks y ajustes por modelo. La línea de comandos cubre lo demás con cuatro órdenes: serve, start, stop y launch, esta última para conectar clientes externos.
oMLX escucha por defecto en 127.0.0.1:8000 y expone ocho endpoints compatibles con OpenAI y con Anthropic. La clave de API viaja en la cabecera Authorization o en x-api-key, admite subclaves que solo llaman a la API y puede omitirse en conexiones locales. Todo se configura en settings.json, por variables de entorno o por banderas.
oMLX se instala con Homebrew en dos órdenes: primero el tap del repositorio de jundot y después la fórmula. Queda un servicio de launchd que arranca con omlx start, un registro en la carpeta var de Homebrew y una actualización con brew upgrade. La versión actual es la 0.6.4, del 29 de agosto de 2026.
oMLX gestiona el ciclo de vida de cada modelo con cuatro piezas: un descargador que trae pesos desde Hugging Face, alias que renombran el modelo en la API, un TTL que lo descarga tras un tiempo inactivo y una caché KV por niveles que vuelca bloques al SSD cuando la RAM se llena.
oMLX MCP es un puente que expone tu servidor local de oMLX como herramientas del Model Context Protocol. Con el paquete mcp_omlx conectas Claude Desktop a los modelos que corren en tu Mac y ganas siete herramientas para listar modelos, cargarlos y liberarlos de memoria, y lanzar inferencias sin salir del cliente.
Receta para oMLX 0.6.4 en un Mac M5 Max con 128 GB: instalación, Claude Code y ajustes avanzados con capturas (Lightning MTP, VLM MTP y DFlash). Incluye benchmarks propios de septiembre de 2026, con hasta 1,88x más tokens por segundo.
40 min3,2K5,0
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).