Fung lideró el artículo de 2023 "Multitask, Multilingual, Multimodal Evaluation of ChatGPT": uno de los primeros estudios empíricos sistemáticos de un LLM sometido simultáneamente a tareas de razonamiento, alucinación e interactividad en varias lenguas. Los hallazgos no dejaban bien al campo: los resultados de evaluación en inglés sobreestimaban de forma consistente la competencia del modelo en lenguas de menores recursos, donde los mismos prompts producían una calidad de razonamiento claramente peor y tasas de alucinación más altas. Para ai100, que audita motores de IA en cinco regiones lingüísticas, esta es la demostración publicada más clara de por qué la evaluación idioma por idioma es una exigencia metodológica, no una extensión opcional de una línea base en inglés.

Vale la pena seguirlo cuando
se necesita evaluar el comportamiento de modelos de lenguaje en varios entornos lingüísticos y se quiere la literatura empírica que muestra por qué las pruebas por idioma no son negociables.
Temas
evaluación multilingüe de LLM (razonamiento, alucinación, diálogo); sistemas de diálogo empáticos y emocionalmente conscientes; las consecuencias metodológicas del diseño de benchmarks centrado en el inglés.
Obras clave
"Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity" (2023, autora sénior); publicaciones de CAiRE sobre IA conversacional; trabajo de largo recorrido en NLP translingüe desde los años noventa.