Categorías

Inteligencia Artificial

LLM-as-judge maduro: cuándo confiar y cuándo no

Usar un LLM como juez de otro LLM se generalizó en 2024 y sigue siendo, en 2026, la única forma escalable de evaluar calidad cualitativa en sistemas con LLM. Es fiable si la correlación juez-humano supera 0,7 en 30 casos y se recalibra cada trimestre; por debajo de ese umbral, no fiarse del número.

Inteligencia Artificial

Claude Sonnet 4.6 en producción: el equilibrio coste-calidad

Claude Sonnet 4.6 es el modelo por defecto en la mayoría de cargas de producción de 2026: cubre el 80% del tráfico con calidad indistinguible de Opus 4.7 en pruebas ciegas y un coste por token que ronda el 60% del de Opus. Sigue haciendo falta Opus en razonamiento complejo y coding agéntico sobre bases grandes.

Herramientas

Code review asistido por IA: adopción honesta

Dos años probando revisiones de código asistidas por IA en un equipo real dejan un balance claro: la IA detecta bien olvidos mecánicos y genera resúmenes útiles de cada pull request, pero falla en juicio arquitectónico y comete muchos falsos positivos en bugs sutiles. La decisión que más ha ayudado ha sido no bloquear el merge por sus comentarios automáticos.