Ruta de aprendizaje Intermedio
LLMs en local: ejecuta modelos en tu hardware
Ejecuta modelos de lenguaje en tu propio hardware, sin API ni cuotas: de Ollama a servir modelos grandes en un Mac, más memoria vectorial para RAG.
- 8 recursos
- 6 visitas
- ~85 min
Ejecuta modelos de lenguaje en tu propia máquina — sin claves de API, sin cuotas y con tus datos siempre en casa. La ruta va de la instalación de Ollama al ajuste fino en un Mac con Apple Silicon, y termina dándole memoria a tu modelo con una base de datos vectorial para RAG.
Cómo instalar Ollama para ejecutar LLM en tu ordenador
Ollama hace trivial ejecutar modelos como Llama 2 o Mistral en tu propio ordenador: un binario, un comando y los pesos cuantizados descargándose al disco sin compilar nada. Esta guía cubre la instalación en macOS, Linux y Windows, con una valoración honesta de lo que la inferencia local puede y no puede hacer frente a los modelos de frontera.
Cómo instalar Ollama en macOS con Apple Silicon
Instalar Ollama en un Mac con Apple Silicon es tan simple como ejecutar un comando de Homebrew. Después, elige el modelo según la RAM disponible (Phi-3 con 8 GB, Llama 3.1 8B con 16 GB) y expón la API HTTP local, compatible con OpenAI, en el puerto 11434 para integrarla en tus propias aplicaciones.
Gemma 4 en local, qué variante cabe en tu GPU
Gemma 4 llega en cinco tamaños con licencia Apache 2.0. Cuantizados a 4 bits, los pesos van de 2,9 GB en el E2B a 17,5 GB en el 31B según la tabla de Google, así que la variante la decide tu memoria. Y la ventana de 256K suma otros 10 GiB de caché.
Modelos multimodales en local: la cuenta de VRAM en una tarjeta de 16 GB
Qwen3-VL 8B en Q4_K_M son 4,68 GiB de pesos más 1,08 GiB de torre de visión, y su cache KV cuesta 144 KiB por token. Con 8.192 tokens de contexto la suma ronda los 7 GiB y cabe de sobra en 16 GB; con los 256K nativos pediría 36 GiB solo de cache y no cabe en ninguna tarjeta de consumo.
Qué es oMLX y en qué se diferencia de MLX, Ollama y LM Studio
oMLX es un servidor de inferencia local para Mac con Apple Silicon que envuelve el framework MLX de Apple en un proceso web y lo expone con las API de OpenAI y de Anthropic. Añade lotes continuos, caché KV en disco y varios modelos en memoria a la vez, gobernados desde la barra de menús.
Cómo instalar oMLX en M5 Max 128 GB y exprimirlo al máximo
Receta para oMLX en Mac M5 Max con 128 GB: instalación, TurboQuant a 3,5-bit, stack Qwen 3.6 35B-A3B, wiring para Claude Code y benchmarks propios. Revisada para oMLX 0.6.4, con lo que ha cambiado desde la 0.3.8.
Cómo instalar PostgreSQL con pgvector paso a paso
Esta guía instala PostgreSQL 16 con pgvector en Debian o Ubuntu usando el repositorio oficial PGDG, crea un rol y una base de datos dedicados, ajusta la memoria para producción y explica cuándo conviene el índice HNSW frente a IVFFlat según el volumen de vectores y la ventana de mantenimiento disponible.
Calculadora LLM en local
¿Cabe ese modelo en tu GPU? ¿Sale más barato auto-alojarlo que la API? Calcula la VRAM y el punto de equilibrio de costes.