Ollama se consolidó en 2024 como el estándar para ejecutar LLMs en local. Empaqueta llama.cpp en un binario único con interfaz de línea de comandos estilo Docker y API compatible con OpenAI. Phi-3 Mini corre en 4 GB; Llama 3.1 8B Q4 necesita 6 GB. Para tráfico de producción a escala, vLLM sigue siendo la opción correcta.
Instalar Ollama en un Mac con Apple Silicon es tan simple como ejecutar un comando de Homebrew. Después, elige el modelo según la RAM disponible (Phi-3 con 8 GB, Llama 3.1 8B con 16 GB) y expón la API HTTP local, compatible con OpenAI, en el puerto 11434 para integrarla en tus propias aplicaciones.
LM Studio es una aplicación de escritorio para Mac, Windows y Linux que descarga y ejecuta modelos de lenguaje grandes en tu propio equipo, con una interfaz de chat pulida y sin necesidad de terminal. Incluye una API compatible con OpenAI y RAG con tus documentos. Para uso individual gana a Ollama en experiencia de usuario; para equipos o producción conviene OpenWebUI, vLLM o TGI.
Ollama hace trivial ejecutar modelos como Llama 2 o Mistral en tu propio ordenador: un binario, un comando y los pesos cuantizados descargándose al disco sin compilar nada. Esta guía cubre la instalación en macOS, Linux y Windows, con una valoración honesta de lo que la inferencia local puede y no puede hacer frente a los modelos de frontera.
6 min4014,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).