Pascale Fung
Déterminer si le même modèle de langage accomplit le même type de travail dans différentes langues — et si la méthodologie d'évaluation construite pour l'anglais nous trompe sur ce que font les modèles dans toutes les autres langues.
Fung a dirigé l'article de 2023 "Multitask, Multilingual, Multimodal Evaluation of ChatGPT" — l'une des premières études empiriques systématiques à faire passer un LLM par des tâches de raisonnement, d'hallucination et d'interactivité dans plusieurs langues simultanément. Les résultats étaient peu flatteurs pour le domaine : les évaluations en anglais surestimaient systématiquement la compétence du modèle dans les langues à faibles ressources, où les mêmes prompts produisaient une qualité de raisonnement nettement inférieure et des taux d'hallucination plus élevés. Pour ai100, qui audite les moteurs d'IA dans cinq régions linguistiques, c'est la démonstration publiée la plus claire du fait qu'une évaluation langue par langue est méthodologiquement nécessaire, et non un simple prolongement facultatif d'une base de référence anglaise.