Charles L. A. Clarke
Was systematische, replizierbare Evaluation von Frage-Antwort-Systemen verlangt — jetzt, da die zu evaluierenden Systeme Sprachmodelle und nicht Retriever sind.
Clarke verbrachte drei Jahrzehnte in der TREC-Evaluationstradition, in der der strenge Vergleich von Retrieval-Systemen gemeinsame Korpora, gemeinsame Anfragen, gemeinsame Relevanzurteile und ein explizites Protokoll zur Auflösung von Uneinigkeit zwischen Assessoren erforderte. Sein Paper „Evaluating Open-Domain QA in the Era of LLMs“ von 2023 trägt diese Disziplin in die Gegenwart weiter und weist darauf hin, dass die meiste LLM-basierte QA-Evaluation stillschweigend einen Großteil dieser Leitplanken fallen gelassen hat — Ground Truth aus einer einzigen Quelle, automatische Beurteiler, die nicht gegen Menschen validiert wurden, kein Protokoll für Antworten, die technisch korrekt, aber stilistisch von der Referenz verschieden sind. Der methodische Reset, für den er argumentiert, steht der ursprünglichen TREC-Haltung näher als nahezu allem, was derzeit in Mode ist.