Categorías

Inteligencia Artificial

TensorRT-LLM: aceleración extrema en GPUs NVIDIA para LLM

TensorRT-LLM es el motor de inferencia de NVIDIA que compila cada modelo en un binario optimizado para la GPU exacta y el tamaño de lote donde se va a servir. Usa kernels CUDA hechos a mano y cuantización FP8 nativa en H100. Frente a vLLM puede rendir entre 2 y 3 veces más en el mejor caso, a cambio de un build de 30 a 90 minutos.

Arquitectura

vLLM: servir LLM en producción con altísimo throughput

vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.