Categorías

Mac

Benchmarks y techo de memoria en oMLX

oMLX trae un banco de pruebas en el panel que mide tiempo hasta el primer token, tiempo por token, tokens por segundo y pico de memoria, con prompts de 1.024 a 200.000 tokens. El techo de memoria por defecto es la RAM del sistema menos 8 GB, y es lo que decide qué contexto cabe.

Mac

El panel de administración de oMLX y su línea de comandos

El panel de oMLX vive en localhost:8000/admin y reúne monitorización, carga y descarga de modelos, chat con historial, descargador de Hugging Face, benchmarks y ajustes por modelo. La línea de comandos cubre lo demás con cuatro órdenes: serve, start, stop y launch, esta última para conectar clientes externos.

Mac

Clave de API, puerto y endpoints de oMLX

oMLX escucha por defecto en 127.0.0.1:8000 y expone ocho endpoints compatibles con OpenAI y con Anthropic. La clave de API viaja en la cabecera Authorization o en x-api-key, admite subclaves que solo llaman a la API y puede omitirse en conexiones locales. Todo se configura en settings.json, por variables de entorno o por banderas.

Mac

Instalar, actualizar y desinstalar oMLX con Homebrew

oMLX se instala con Homebrew en dos órdenes: primero el tap del repositorio de jundot y después la fórmula. Queda un servicio de launchd que arranca con omlx start, un registro en la carpeta var de Homebrew y una actualización con brew upgrade. La versión actual es la 0.6.4, del 29 de agosto de 2026.

Mac

Gestión de modelos en oMLX: descarga, alias, TTL y caché en disco

oMLX gestiona el ciclo de vida de cada modelo con cuatro piezas: un descargador que trae pesos desde Hugging Face, alias que renombran el modelo en la API, un TTL que lo descarga tras un tiempo inactivo y una caché KV por niveles que vuelca bloques al SSD cuando la RAM se llena.

Mac

oMLX como servidor MCP: controla tus modelos locales desde Claude

oMLX MCP es un puente que expone tu servidor local de oMLX como herramientas del Model Context Protocol. Con el paquete mcp_omlx conectas Claude Desktop a los modelos que corren en tu Mac y ganas siete herramientas para listar modelos, cargarlos y liberarlos de memoria, y lanzar inferencias sin salir del cliente.