La ligne de recherche de Lou à MSR Asia a travaillé sur le rare problème d'évaluation des LLM où la correction est sans ambiguïté : la génération de code. Soit le programme généré compile, s'exécute et produit la bonne sortie, soit il ne le fait pas — ce qui signifie que la méthodologie d'évaluation peut contourner la plupart des problèmes de LLM-juge qui minent l'évaluation de la génération ouverte. Les contributions de son groupe à l'évaluation de l'in-context learning et aux benchmarks de synthèse de programmes s'appuient sur cet avantage : une littérature qui sait ce que « correct » signifie et qui utilise cette clarté comme levier pour interroger d'autres parties du comportement des modèles.

À lire lorsque
vous voulez étudier la méthodologie d'évaluation des LLM dans le rare contexte où la vérité terrain est sans ambiguïté — et voir ce que cette clarté apporte par rapport à l'évaluation ouverte.
Thèmes
méthodologie d'évaluation de la synthèse de programmes; rigueur de l'in-context learning pour la génération de code; contraste entre vérité terrain sans ambiguïté et évaluation ouverte.
Travaux clés
ensemble de travaux sur la synthèse de programmes et l'évaluation de la génération de code à Microsoft Research Asia (2018 et après); publications sur l'évaluation de l'in-context learning; contributions d'ACM Distinguished Member à la recherche appliquée sur les LLM.