smolagents es la biblioteca de agentes de Hugging Face: en menos de mil líneas de código te deja crear un agente que razona escribiendo Python en lugar de rellenar JSON. Su CodeAgent ejecuta esas acciones como código, da alrededor de un 30% menos de pasos que el tool calling clásico y funciona con cualquier modelo, local o de API.
LoRA reduce el coste del fine-tuning de modelos de lenguaje al entrenar solo pequeñas matrices de adaptación de rango bajo, no todos los parámetros del modelo base. QLoRA añade cuantización a 4 bits, lo que recorta la memoria de GPU necesaria entre un 65 % y un 75 %, con una pérdida de calidad de solo 1-3 %.
Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.
5 min3644,4
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).