Categorías

Tecnología

Alternativas a NVIDIA en 2026: hacia dónde va el mercado

NVIDIA sigue dominando el entrenamiento de modelos de frontera en 2026, pero en inferencia el panorama es distinto. AMD MI300X/MI325X con ROCm maduro, Intel Gaudi 3, TPU v6 de Google y AWS Trainium/Inferentia ofrecen entre un 20 y un 50% de ahorro por token sin sacrificar calidad. Repasamos cuándo elegir cada opción.

Inteligencia Artificial

FinOps para cargas de IA en 2026: el dolor real

La factura de IA en las empresas ha dejado de ser anecdótica. Entre tokens de modelos frontera, GPUs reservadas que nadie usa y pipelines RAG con cachés mal configuradas, muchos equipos pagan diez veces lo que deberían. Guía de FinOps específico para IA sin relatos promocionales.

Tecnología

GPUs Blackwell de NVIDIA: lo que cambia en el entrenamiento

Los primeros racks GB200 NVL72 llevan meses en manos de los hiperescalares y ya empiezan a verse mediciones públicas. La generación Blackwell no es una mejora incremental sobre Hopper, sino un cambio en la forma de entrenar modelos grandes. Repasamos qué cambia y qué no.

Inteligencia Artificial

vLLM en 2025: las mejoras que importan a quien sirve LLM

vLLM sigue siendo el motor de referencia para servir LLM en GPU en 2025: el prefix caching automático recorta drásticamente la latencia con prompts repetidos, el speculative decoding acelera los modelos grandes y el soporte multi-LoRA abarata el SaaS multi-tenant, aunque el multi-GPU y el hardware no NVIDIA siguen siendo puntos débiles.

Inteligencia Artificial

TensorRT-LLM: aceleración extrema en GPUs NVIDIA para LLM

TensorRT-LLM es el motor de inferencia de NVIDIA que compila cada modelo en un binario optimizado para la GPU exacta y el tamaño de lote donde se va a servir. Usa kernels CUDA hechos a mano y cuantización FP8 nativa en H100. Frente a vLLM puede rendir entre 2 y 3 veces más en el mejor caso, a cambio de un build de 30 a 90 minutos.

Arquitectura

vLLM: servir LLM en producción con altísimo throughput

vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.

Desarrollo de Software

Zed: un editor moderno pensado para la colaboración

Zed es el editor de los creadores de Atom, reescrito en Rust con un framework de UI propio que renderiza en GPU, sin Electron. Ofrece latencia de ~8 ms, colaboración en tiempo real con voz integrada y cursores compartidos, y licencia abierta (GPL v3). Una alternativa seria a VS Code para equipos de 2 a 4 personas.

Inteligencia Artificial

TGI de Hugging Face: servir modelos abiertos a escala

Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.