Categorías

Inteligencia Artificial

FinOps para cargas de IA en 2026: el dolor real

La factura de IA en las empresas ha dejado de ser anecdótica. Entre tokens de modelos frontera, GPUs reservadas que nadie usa y pipelines RAG con cachés mal configuradas, muchos equipos pagan diez veces lo que deberían. Guía de FinOps específico para IA sin relatos promocionales.

Inteligencia Artificial

vLLM en 2025: las mejoras que importan a quien sirve LLM

vLLM sigue siendo el motor de referencia para servir LLM en GPU en 2025: el prefix caching automático recorta drásticamente la latencia con prompts repetidos, el speculative decoding acelera los modelos grandes y el soporte multi-LoRA abarata el SaaS multi-tenant, aunque el multi-GPU y el hardware no NVIDIA siguen siendo puntos débiles.

Arquitectura

vLLM: servir LLM en producción con altísimo throughput

vLLM sirve modelos de lenguaje en GPU con PagedAttention y batching continuo, dos técnicas que multiplican el throughput frente a un servidor ingenuo. Expone una API compatible con OpenAI, así que migrar una aplicación existente solo exige cambiar la URL base y desplegar el binario correcto.

Desarrollo de Software

Zed: un editor moderno pensado para la colaboración

Zed es el editor de los creadores de Atom, reescrito en Rust con un framework de UI propio que renderiza en GPU, sin Electron. Ofrece latencia de ~8 ms, colaboración en tiempo real con voz integrada y cursores compartidos, y licencia abierta (GPL v3). Una alternativa seria a VS Code para equipos de 2 a 4 personas.

Inteligencia Artificial

TGI de Hugging Face: servir modelos abiertos a escala

Text Generation Inference (TGI) es la pila de inferencia de Hugging Face para servir LLM abiertos en producción: continuous batching, cuantización de 4 y 8 bits, streaming y una API compatible con OpenAI. Tras un episodio de licencia restrictiva en 2023, volvió a Apache 2.0 en la versión 2.0.