Arquitectura
vLLM: servir LLM en producción con altísimo throughput
vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.