Jian-Guang Lou
Savoir si un modèle de langage qui produit du code produit effectivement du code qui fait ce que la demande exigeait — et à quoi ressemble l'évaluation lorsque, pour une fois, la correction a une réponse définie.
La ligne de recherche de Lou à MSR Asia a travaillé sur le rare problème d'évaluation des LLM où la correction est sans ambiguïté : la génération de code. Soit le programme généré compile, s'exécute et produit la bonne sortie, soit il ne le fait pas — ce qui signifie que la méthodologie d'évaluation peut contourner la plupart des problèmes de LLM-juge qui minent l'évaluation de la génération ouverte. Les contributions de son groupe à l'évaluation de l'in-context learning et aux benchmarks de synthèse de programmes s'appuient sur cet avantage : une littérature qui sait ce que « correct » signifie et qui utilise cette clarté comme levier pour interroger d'autres parties du comportement des modèles.