vLLM: Serving LLMs in Production with Very High Throughput

vLLM se ha convertido en la referencia para servir LLM en GPU. PagedAttention, batching continuo y API compatible con OpenAI. Cómo desplegarlo bien y cuándo compensa.

180 13 min October 5, 2024 4.5

Desarrollo de Software

SGLang: Fine Control Over LLM Execution

SGLang añade un DSL para controlar la generación de LLM con decoding restringido, branching y caché de prefijos. Cuándo supera a vLLM y por qué RadixAttention cambia la aritmética.

112 9 min June 10, 2024 4.5

Inteligencia Artificial

Hugging Face TGI: Serving Open Models at Scale

Text Generation Inference es la pila de servicio de Hugging Face para LLM abiertos. Cuándo tiene sentido, qué optimizaciones aporta gratis y sus límites reales.

175 9 min January 3, 2024 4.4