Steven Schockaert
Wie ein retrieval-augmentiertes System end-to-end evaluiert wird, wenn jeder seiner Teile auf andere Weise versagen kann.
Ein RAG-System kann an mindestens drei Stellen schiefgehen: Der Retriever holt den falschen Kontext, der Generator ignoriert den Kontext, den er bekommen hat, oder die Antwort klingt plausibel, ist aber durch das Abgerufene nicht gestützt. Schockaerts RAGAs-Framework (2023, Seniorautor) gab dem Feld den ersten Satz automatisierter Metriken, der diese Fehlermodi auseinanderhält — Quellentreue, Antwortrelevanz, Kontextpräzision und Kontext-Recall —, statt sie in einen einzigen Qualitätswert zu pressen. Der methodische Punkt liegt näher an ai100s eigener Scoring-Philosophie als die meisten Evaluationsframeworks: Man darf ein System nicht gut nennen, wenn man nicht sagen kann, welcher Teil davon funktioniert.