Categorías

Inteligencia Artificial

Frameworks de evaluación para retrieval: Ragas y similares

Evaluar un sistema RAG sin métricas es pura intuición. Ragas mide cuatro señales clave: faithfulness, answer relevancy, context precision y context recall, apoyándose en un LLM como juez. TruLens, DeepEval y otros frameworks cubren enfoques similares. Integrar la evaluación en CI desde el primer día detecta regresiones de prompts, chunking o modelo antes de que lleguen a producción.