Philip S. Yu
Relier quatre décennies de méthodologie de fouille de données à la question de savoir comment évaluer les grands modèles de langage sans réinventer des techniques que le domaine possède déjà.
La production publiée de Yu couvre une grande partie de ce qui compte comme fouille de données depuis que le domaine porte ce nom — fouille de flux, découverte de motifs séquentiels, graphes de connaissances, détection d'anomalies — produite pendant son long passage à IBM Research puis poursuivie à UIC, avec plusieurs centaines de brevets au passage. Sa co-signature de "A Survey on Evaluation of LLMs" se lit comme la rencontre, par le haut, de cette œuvre avec la littérature d'évaluation des LLM : beaucoup des questions statistiques et méthodologiques auxquelles l'évaluation actuelle des LLM fait face ont déjà reçu, partiellement, des réponses dans des techniques développées il y a des décennies pour des problèmes semblables sur des données à plus petite échelle. Le lire, c'est découvrir que certaines méthodes d'évaluation actuelles dites « nouvelles » sont des redécouvertes.