vLLM en 2025: las mejoras que importan a quien sirve LLM

vLLM se ha consolidado como el motor de serving de LLM más adoptado en producción. Repaso de las mejoras recientes, qué cambia para quien lo opera y qué sigue siendo punto débil.

61 11 min febrero 14, 2025 4,5

Arquitectura

vLLM: servir LLM en producción con altísimo throughput

vLLM se ha convertido en la referencia para servir LLM en GPU. PagedAttention, batching continuo y API compatible con OpenAI. Cómo desplegarlo bien y cuándo compensa.

64 13 min octubre 5, 2024 4,5

Desarrollo de Software

SGLang: control fino sobre la ejecución de LLM

SGLang añade un DSL para controlar la generación de LLM con decoding restringido, branching y caché de prefijos. Cuándo supera a vLLM y por qué RadixAttention cambia la aritmética.

51 9 min junio 10, 2024 4,5