Steven Schockaert
Comment évaluer de bout en bout un système de génération augmentée par recherche (RAG) lorsque chacune de ses parties peut échouer de façon différente.
Un système RAG a au moins trois endroits où il peut mal tourner : le module de recherche (retriever) récupère le mauvais contexte, le générateur ignore le contexte qui lui a été donné, ou la réponse semble plausible mais n'est pas étayée par ce qui a été récupéré. Le cadre RAGAs de Schockaert (2023, auteur senior) a donné au domaine son premier ensemble de métriques automatisées capables de dissocier ces modes d'échec — fidélité (à la source), pertinence de la réponse, précision et rappel du contexte — au lieu de les écraser dans un score de qualité unique. Le point méthodologique est plus proche de la philosophie de notation (scoring) propre à ai100 que la plupart des cadres d'évaluation : vous n'avez pas le droit de dire qu'un système est bon si vous ne pouvez pas dire quelle partie fonctionne.