Categorías

Agentes IA

Cómo usar DeepSeek Harness con un modelo local

DeepSeek Harness (dsh) es el arnés de agentes de código abierto que DeepSeek publicó en agosto de 2026. Funciona con un modelo local si declaras en settings.yaml un proveedor openai-completions que apunte a llama-server, con una clave de relleno y el contexto real. Con Qwen3.5-4B en CPU dejó los tests en verde en 4 de 5 intentos, pero despacio.

Cómo Instalar

Cómo instalar OpenClaw con Docker y un modelo local

OpenClaw 2026.9.4 se instala con Docker Compose desde la imagen oficial de GHCR, que existe para amd64 y arm64. Para usarlo sin API en la nube, conéctalo a un llama-server en la red interna del compose. Publica el puerto 18789 solo en 127.0.0.1, porque el compose del repositorio lo abre en todas las interfaces.

Inteligencia Artificial

Cómo importar un modelo de Hugging Face en Ollama 0.34

Desde Ollama 0.34.1, ollama create ya no convierte ni cuantiza pesos safetensors. Para importar un modelo de Hugging Face, descárgalo con hf download, conviértelo a GGUF con convert_hf_to_gguf.py de llama.cpp, cuantízalo con llama-quantize y créalo desde un Modelfile. Con MiniCPM5-2B en CPU, las tres fases tardaron 35 s, 21 s y 2 s.

Cómo Instalar

Cómo instalar llama.cpp en Linux, macOS y Docker

Para instalar llama.cpp tienes cuatro vías: el script de llama.app, que deja un binario llama de 15 MB en ~/.local/bin; Homebrew; la imagen Docker server-v0.4.1; o CMake. Las probé el 14 de septiembre de 2026 en Linux arm64 con Gemma 4 E2B, en la terminal con llama cli y como API compatible con OpenAI.

Inteligencia Artificial

llama.cpp: optimizaciones que siguen sorprendiendo

llama.cpp es la biblioteca en C++ que impulsa a Ollama y gran parte del ecosistema de LLM locales. En 2024 sumó decodificación especulativa con aceleraciones de dos a tres veces, un servidor RPC para repartir capas entre máquinas y un formato GGUF estable. Ollama basta para el 90% de los casos; ir directo compensa con hardware poco común.

Herramientas

Ollama en 2024: ejecutar LLM localmente sin dolor

Ollama se consolidó en 2024 como el estándar para ejecutar LLMs en local. Empaqueta llama.cpp en un binario único con interfaz de línea de comandos estilo Docker y API compatible con OpenAI. Phi-3 Mini corre en 4 GB; Llama 3.1 8B Q4 necesita 6 GB. Para tráfico de producción a escala, vLLM sigue siendo la opción correcta.

Herramientas

Cuantización de modelos y llama.cpp en tu portátil

Con cuantización, los pesos de un modelo se guardan con menos bits (4, 5 u 8 en vez de 16), así que Llama 2 13B pasa de 26 GB a unos 7,5 GB. Con llama.cpp corre en un portátil normal de 16 GB de RAM sin GPU dedicada, y la pérdida de calidad es menor de lo que la intuición sugiere.