Categorías

Agentes IA

Cómo usar OpenCode con modelos locales en llama.cpp y Ollama

OpenCode usa un modelo local si declaras en opencode.json un proveedor @ai-sdk/openai-compatible con la URL de llama-server u Ollama y el límite de contexto del modelo. La versión 1.18.31 envía 7.516 tokens en su primer turno, así que los 4k que Ollama asigna por defecto sin GPU grande no bastan: reserva 32k.

Agentes IA

Cómo crear un agente con Dify Agent y un modelo local

Dify Agent, el agente con sandbox Linux de Dify 1.16, funciona con un modelo local si instalas el plugin de Ollama y activas las llamadas a herramientas. Con Dify 1.17.1 y Qwen3.5-4B en CPU, el agente publicado dio cifras correctas en tres de tres pruebas; el modo Build no terminó ninguna de sus tres sesiones.

Cómo Instalar

Cómo activar la IA local de Paperless-ngx 3 con Ollama

Paperless-ngx 3 sugiere título, etiquetas, corresponsal y fechas con un LLM y responde preguntas sobre tus documentos, todo en tu propio servidor con Ollama. Se actualiza desde la 2.20.15 cambiando la etiqueta de la imagen. En CPU, Gemma 4 E4B tardó 25,8 s por sugerencia y ocupó unos 7 GiB, si esquivas un fallo con los modelos que razonan.

Inteligencia Artificial

Cómo importar un modelo de Hugging Face en Ollama 0.34

Desde Ollama 0.34.1, ollama create ya no convierte ni cuantiza pesos safetensors. Para importar un modelo de Hugging Face, descárgalo con hf download, conviértelo a GGUF con convert_hf_to_gguf.py de llama.cpp, cuantízalo con llama-quantize y créalo desde un Modelfile. Con MiniCPM5-2B en CPU, las tres fases tardaron 35 s, 21 s y 2 s.

Inteligencia Artificial

Function calling con Ollama en tu propia máquina

El function calling permite que un modelo que ejecutas con Ollama en tu propia máquina pida a tu código que llame a una función (consultar el clima, buscar en una base de datos) y use el resultado para responder. Desde julio de 2024 Ollama soporta herramientas; en 2026 modelos como qwen3 o llama3.3 lo hacen con fiabilidad razonable.

Herramientas

Ollama en 2024: ejecutar LLM localmente sin dolor

Ollama se consolidó en 2024 como el estándar para ejecutar LLMs en local. Empaqueta llama.cpp en un binario único con interfaz de línea de comandos estilo Docker y API compatible con OpenAI. Phi-3 Mini corre en 4 GB; Llama 3.1 8B Q4 necesita 6 GB. Para tráfico de producción a escala, vLLM sigue siendo la opción correcta.

Cómo Instalar

Cómo instalar Ollama en macOS con Apple Silicon

Instalar Ollama en un Mac con Apple Silicon es tan simple como ejecutar un comando de Homebrew. Después, elige el modelo según la RAM disponible (Phi-3 con 8 GB, Llama 3.1 8B con 16 GB) y expón la API HTTP local, compatible con OpenAI, en el puerto 11434 para integrarla en tus propias aplicaciones.

Herramientas

LM Studio: explorar modelos de IA desde el escritorio

LM Studio es una aplicación de escritorio para Mac, Windows y Linux que descarga y ejecuta modelos de lenguaje grandes en tu propio equipo, con una interfaz de chat pulida y sin necesidad de terminal. Incluye una API compatible con OpenAI y RAG con tus documentos. Para uso individual gana a Ollama en experiencia de usuario; para equipos o producción conviene OpenWebUI, vLLM o TGI.

Cómo Instalar

Cómo instalar Ollama para ejecutar LLM en tu ordenador

Ollama hace trivial ejecutar modelos como Llama 2 o Mistral en tu propio ordenador: un binario, un comando y los pesos cuantizados descargándose al disco sin compilar nada. Esta guía cubre la instalación en macOS, Linux y Windows, con una valoración honesta de lo que la inferencia local puede y no puede hacer frente a los modelos de frontera.