NVIDIA sigue dominando el entrenamiento de modelos de frontera en 2026, pero en inferencia el panorama es distinto. AMD MI300X/MI325X con ROCm maduro, Intel Gaudi 3, TPU v6 de Google y AWS Trainium/Inferentia ofrecen entre un 20 y un 50% de ahorro por token sin sacrificar calidad. Repasamos cuándo elegir cada opción.
La factura de IA en las empresas ha dejado de ser anecdótica. Entre tokens de modelos frontera, GPUs reservadas que nadie usa y pipelines RAG con cachés mal configuradas, muchos equipos pagan diez veces lo que deberían. Guía de FinOps específico para IA sin relatos promocionales.
Los primeros racks GB200 NVL72 llevan meses en manos de los hiperescalares y ya empiezan a verse mediciones públicas. La generación Blackwell no es una mejora incremental sobre Hopper, sino un cambio en la forma de entrenar modelos grandes. Repasamos qué cambia y qué no.
vLLM sigue siendo el motor de referencia para servir LLM en GPU en 2025: el prefix caching automático recorta drásticamente la latencia con prompts repetidos, el speculative decoding acelera los modelos grandes y el soporte multi-LoRA abarata el SaaS multi-tenant, aunque el multi-GPU y el hardware no NVIDIA siguen siendo puntos débiles.
TensorRT-LLM es el motor de inferencia de NVIDIA que compila cada modelo en un binario optimizado para la GPU exacta y el tamaño de lote donde se va a servir. Usa kernels CUDA hechos a mano y cuantización FP8 nativa en H100. Frente a vLLM puede rendir entre 2 y 3 veces más en el mejor caso, a cambio de un build de 30 a 90 minutos.
vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.
Zed es el editor de los creadores de Atom, reescrito en Rust con un framework de UI propio que renderiza en GPU, sin Electron. Ofrece latencia de ~8 ms, colaboración en tiempo real con voz integrada y cursores compartidos, y licencia abierta (GPL v3). Una alternativa seria a VS Code para equipos de 2 a 4 personas.
Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.
5 min3554,4
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).