Usar un LLM como juez de otro LLM se generalizó en 2024 y sigue siendo, en 2026, la única forma escalable de evaluar calidad cualitativa en sistemas con LLM. Es fiable si la correlación juez-humano supera 0,7 en 30 casos y se recalibra cada trimestre; por debajo de ese umbral, no fiarse del número.
Claude Sonnet 4.6 es el modelo por defecto en la mayoría de cargas de producción de 2026: cubre el 80% del tráfico con calidad indistinguible de Opus 4.7 en pruebas ciegas y un coste por token que ronda el 60% del de Opus. Sigue haciendo falta Opus en razonamiento complejo y coding agéntico sobre bases grandes.
Después de año y medio llenando tableros con agentes en producción, la pregunta que separa equipos que envían fiable de los que van a ciegas sigue siendo la misma: ¿cómo mides que el agente está funcionando?
Dos años probando revisiones de código asistidas por IA en un equipo real dejan un balance claro: la IA detecta bien olvidos mecánicos y genera resúmenes útiles de cada pull request, pero falla en juicio arquitectónico y comete muchos falsos positivos en bugs sutiles. La decisión que más ha ayudado ha sido no bloquear el merge por sus comentarios automáticos.
8 min2784,4
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).