oMLX trae un banco de pruebas en el panel que mide tiempo hasta el primer token, tiempo por token, tokens por segundo y pico de memoria, con prompts de 1.024 a 200.000 tokens. El techo de memoria por defecto es la RAM del sistema menos 8 GB, y es lo que decide qué contexto cabe.
oMLX es un servidor de inferencia local para Mac con Apple Silicon que envuelve el framework MLX de Apple en un proceso web y lo expone con las API de OpenAI y de Anthropic. Añade lotes continuos, caché KV en disco y varios modelos en memoria a la vez, gobernados desde la barra de menús.
El panel de oMLX vive en localhost:8000/admin y reúne monitorización, carga y descarga de modelos, chat con historial, descargador de Hugging Face, benchmarks y ajustes por modelo. La línea de comandos cubre lo demás con cuatro órdenes: serve, start, stop y launch, esta última para conectar clientes externos.
oMLX escucha por defecto en 127.0.0.1:8000 y expone ocho endpoints compatibles con OpenAI y con Anthropic. La clave de API viaja en la cabecera Authorization o en x-api-key, admite subclaves que solo llaman a la API y puede omitirse en conexiones locales. Todo se configura en settings.json, por variables de entorno o por banderas.
oMLX se instala con Homebrew en dos órdenes: primero el tap del repositorio de jundot y después la fórmula. Queda un servicio de launchd que arranca con omlx start, un registro en la carpeta var de Homebrew y una actualización con brew upgrade. La versión actual es la 0.6.4, del 29 de agosto de 2026.
oMLX gestiona el ciclo de vida de cada modelo con cuatro piezas: un descargador que trae pesos desde Hugging Face, alias que renombran el modelo en la API, un TTL que lo descarga tras un tiempo inactivo y una caché KV por niveles que vuelca bloques al SSD cuando la RAM se llena.
oMLX MCP es un puente que expone tu servidor local de oMLX como herramientas del Model Context Protocol. Con el paquete mcp_omlx conectas Claude Desktop a los modelos que corren en tu Mac y ganas siete herramientas para listar modelos, cargarlos y liberarlos de memoria, y lanzar inferencias sin salir del cliente.
Receta para oMLX en Mac M5 Max con 128 GB: instalación, TurboQuant a 3,5-bit, stack Qwen 3.6 35B-A3B, wiring para Claude Code y benchmarks propios. Revisada para oMLX 0.6.4, con lo que ha cambiado desde la 0.3.8.
Guía de 100 aplicaciones imprescindibles para tu Mac M5, organizadas en 20 categorías: navegador, gestor de contraseñas, email, notas, terminal, IDE, contenedores, IA y muchas más. Cada selección incluye propósito, características clave, plugins esenciales, precio en euros y enlace oficial, seleccionadas por consenso comunitario y métricas verificables.
Instalar Ollama en un Mac con Apple Silicon es tan simple como ejecutar un comando de Homebrew. Después, elige el modelo según la RAM disponible (Phi-3 con 8 GB, Llama 3.1 8B con 16 GB) y expón la API HTTP local, compatible con OpenAI, en el puerto 11434 para integrarla en tus propias aplicaciones.
7 min1,2K4,1
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).