Ollama 0.34.1 a 0.34.4 rechazan con HTTP 400 cualquier petición a /api/chat o /api/generate que lleve typical_p en options, aunque valga 1.0. Se arregla quitando el campo en el cliente, volviendo a 0.34.0, pasando por el endpoint /v1 o subiendo a 0.40.0, que solo registra un aviso.
OpenCode usa un modelo local si declaras en opencode.json un proveedor @ai-sdk/openai-compatible con la URL de llama-server u Ollama y el límite de contexto del modelo. La versión 1.18.31 envía 7.516 tokens en su primer turno, así que los 4k que Ollama asigna por defecto sin GPU grande no bastan: reserva 32k.
Dify Agent, el agente con sandbox Linux de Dify 1.16, funciona con un modelo local si instalas el plugin de Ollama y activas las llamadas a herramientas. Con Dify 1.17.1 y Qwen3.5-4B en CPU, el agente publicado dio cifras correctas en tres de tres pruebas; el modo Build no terminó ninguna de sus tres sesiones.
Paperless-ngx 3 sugiere título, etiquetas, corresponsal y fechas con un LLM y responde preguntas sobre tus documentos, todo en tu propio servidor con Ollama. Se actualiza desde la 2.20.15 cambiando la etiqueta de la imagen. En CPU, Gemma 4 E4B tardó 25,8 s por sugerencia y ocupó unos 7 GiB, si esquivas un fallo con los modelos que razonan.
Desde Ollama 0.34.1, ollama create ya no convierte ni cuantiza pesos safetensors. Para importar un modelo de Hugging Face, descárgalo con hf download, conviértelo a GGUF con convert_hf_to_gguf.py de llama.cpp, cuantízalo con llama-quantize y créalo desde un Modelfile. Con MiniCPM5-2B en CPU, las tres fases tardaron 35 s, 21 s y 2 s.
Qwen3-VL 8B en Q4_K_M son 4,68 GiB de pesos más 1,08 GiB de torre de visión, y su cache KV cuesta 144 KiB por token. Con 8.192 tokens de contexto la suma ronda los 7 GiB y cabe de sobra en 16 GB; con los 256K nativos pediría 36 GiB solo de cache y no cabe en ninguna tarjeta de consumo.
Gemma 4 llega en cinco tamaños con licencia Apache 2.0. Cuantizados a 4 bits, los pesos van de 2,9 GB en el E2B a 17,5 GB en el 31B según la tabla de Google, así que la variante la decide tu memoria. Y la ventana de 256K suma otros 10 GiB de caché.
Agosto de 2026 dejó una decena de modelos con pesos realmente descargables, y también varios nombres que solo existen como API alojada. Los que cambian lo que cabe en un equipo propio son Muse Glimmer 30B y Qwen3.8-27B, ambos con licencia Apache 2.0, más Ling-3.0-tiny para máquinas pequeñas.
El function calling permite que un modelo que ejecutas con Ollama en tu propia máquina pida a tu código que llame a una función (consultar el clima, buscar en una base de datos) y use el resultado para responder. Desde julio de 2024 Ollama soporta herramientas; en 2026 modelos como qwen3 o llama3.3 lo hacen con fiabilidad razonable.
Ollama 0.5 o superior ejecuta Llama 3.3 70B y Mistral Large 2 en local sobre Ubuntu 24.04: la cuantización Q4_K_M deja que una sola GPU NVIDIA de 24 GB de VRAM, una RTX 4090 por ejemplo, mueva el modelo completo. Esta guía instala los drivers, monta Open WebUI y expone el servicio tras Traefik con TLS.
Ollama se consolidó en 2024 como el estándar para ejecutar LLMs en local. Empaqueta llama.cpp en un binario único con interfaz de línea de comandos estilo Docker y API compatible con OpenAI. Phi-3 Mini corre en 4 GB; Llama 3.1 8B Q4 necesita 6 GB. Para tráfico de producción a escala, vLLM sigue siendo la opción correcta.
Instalar Ollama en un Mac con Apple Silicon es tan simple como ejecutar un comando de Homebrew. Después, elige el modelo según la RAM disponible (Phi-3 con 8 GB, Llama 3.1 8B con 16 GB) y expón la API HTTP local, compatible con OpenAI, en el puerto 11434 para integrarla en tus propias aplicaciones.
LM Studio es una aplicación de escritorio para Mac, Windows y Linux que descarga y ejecuta modelos de lenguaje grandes en tu propio equipo, con una interfaz de chat pulida y sin necesidad de terminal. Incluye una API compatible con OpenAI y RAG con tus documentos. Para uso individual gana a Ollama en experiencia de usuario; para equipos o producción conviene OpenWebUI, vLLM o TGI.
Ollama hace trivial ejecutar modelos como Llama 2 o Mistral en tu propio ordenador: un binario, un comando y los pesos cuantizados descargándose al disco sin compilar nada. Esta guía cubre la instalación en macOS, Linux y Windows, con una valoración honesta de lo que la inferencia local puede y no puede hacer frente a los modelos de frontera.
6 min4084,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).