Categorías

Inteligencia Artificial

Cómo importar un modelo de Hugging Face en Ollama 0.34

Desde Ollama 0.34.1, ollama create ya no convierte ni cuantiza pesos safetensors. Para importar un modelo de Hugging Face, descárgalo con hf download, conviértelo a GGUF con convert_hf_to_gguf.py de llama.cpp, cuantízalo con llama-quantize y créalo desde un Modelfile. Con MiniCPM5-2B en CPU, las tres fases tardaron 35 s, 21 s y 2 s.

Inteligencia Artificial

smolagents de Hugging Face: agentes que piensan en código

smolagents es la biblioteca de agentes de Hugging Face: con su lógica en un solo archivo, te deja crear un agente que razona escribiendo Python en lugar de rellenar JSON. Su CodeAgent da alrededor de un 30% menos de pasos que el tool calling clásico, y lo probamos con la versión 1.26.0 y un modelo local en Ollama.

Inteligencia Artificial

TGI de Hugging Face: servir modelos abiertos a escala

Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.