La production publiée de Yu couvre une grande partie de ce qui compte comme fouille de données depuis que le domaine porte ce nom — fouille de flux, découverte de motifs séquentiels, graphes de connaissances, détection d'anomalies — produite pendant son long passage à IBM Research puis poursuivie à UIC, avec plusieurs centaines de brevets au passage. Sa co-signature de "A Survey on Evaluation of LLMs" se lit comme la rencontre, par le haut, de cette œuvre avec la littérature d'évaluation des LLM : beaucoup des questions statistiques et méthodologiques auxquelles l'évaluation actuelle des LLM fait face ont déjà reçu, partiellement, des réponses dans des techniques développées il y a des décennies pour des problèmes semblables sur des données à plus petite échelle. Le lire, c'est découvrir que certaines méthodes d'évaluation actuelles dites « nouvelles » sont des redécouvertes.

À lire lorsque
vous voulez une évaluation des LLM ancrée dans l'histoire plus longue de la méthodologie de fouille de données, plutôt que traitée comme une discipline qui commence en 2020.
Thèmes
longue trajectoire de la méthodologie de fouille de données pertinente pour l'évaluation des LLM; fouille de flux et fouille de motifs séquentiels; pont entre techniques héritées et évaluation moderne des modèles.
Travaux clés
travaux fondateurs sur la fouille de flux et la découverte de motifs séquentiels (années 1990–2000); co-signature de "A Survey on Evaluation of LLMs" (2024); décennies de publications méthodologiques en fouille de données à IBM Research et UIC.