Fung a dirigé l'article de 2023 "Multitask, Multilingual, Multimodal Evaluation of ChatGPT" — l'une des premières études empiriques systématiques à faire passer un LLM par des tâches de raisonnement, d'hallucination et d'interactivité dans plusieurs langues simultanément. Les résultats étaient peu flatteurs pour le domaine : les évaluations en anglais surestimaient systématiquement la compétence du modèle dans les langues à faibles ressources, où les mêmes prompts produisaient une qualité de raisonnement nettement inférieure et des taux d'hallucination plus élevés. Pour ai100, qui audite les moteurs d'IA dans cinq régions linguistiques, c'est la démonstration publiée la plus claire du fait qu'une évaluation langue par langue est méthodologiquement nécessaire, et non un simple prolongement facultatif d'une base de référence anglaise.

À lire lorsque
vous devez évaluer le comportement des modèles de langage dans plusieurs environnements linguistiques et voulez la littérature empirique qui montre pourquoi les tests par langue ne sont pas négociables.
Thèmes
évaluation multilingue des LLM (raisonnement, hallucination, dialogue); systèmes de dialogue empathiques et sensibles à l'émotion; conséquences méthodologiques d'une conception de benchmarks centrée sur l'anglais.
Travaux clés
"Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity" (2023, auteur senior); publications de CAiRE sur l'IA conversationnelle; travaux au long cours sur le NLP interlinguistique depuis les années 1990.