Categorías

Arquitectura

vLLM: servir LLM en producción con altísimo throughput

vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.

Desarrollo de Software

SGLang: control fino sobre la ejecución de LLM

SGLang añade un DSL en Python para controlar la generación de LLM con decoding restringido, branching paralelo y RadixAttention, la estructura que indexa el caché KV en un trie radix para reutilizar prefijos compartidos entre peticiones. Cuando ese patrón existe, los speedups frente a vLLM llegan hasta 5 veces; sin él, la ventaja se diluye.

Inteligencia Artificial

TGI de Hugging Face: servir modelos abiertos a escala

Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.