Un sistema RAG tiene al menos tres lugares donde puede equivocarse: el recuperador trae el contexto equivocado, el generador ignora el contexto que recibió, o la respuesta suena plausible pero no está respaldada por lo recuperado. El framework RAGAs de Schockaert (2023, autor sénior) dio al campo su primer conjunto de métricas automatizadas que separan estos modos de fallo —fidelidad (a la fuente), relevancia de la respuesta, precisión y exhaustividad del contexto— en lugar de colapsarlos en una única puntuación de calidad. El punto metodológico está más cerca de la filosofía de puntuación de ai100 que la mayoría de los frameworks de evaluación: no se puede llamar bueno a un sistema si no se puede decir qué parte de él funciona.

Vale la pena seguirlo cuando
se necesita evaluar un pipeline RAG y se quiere atribuir el fallo a la recuperación, a la generación o a la integración entre ambas.
Temas
métricas automatizadas de evaluación de RAG; separación de fallos del lado de la recuperación y del lado de la generación; diseño de métricas para pipelines de varias etapas.
Obras clave
RAGAs: Automated Evaluation of Retrieval Augmented Generation (2023, autor sénior); trabajo en curso de Cardiff NLP sobre RAG y LLM aumentados con conocimiento.