Pascale Fung
Si el mismo modelo de lenguaje realiza el mismo tipo de trabajo en distintas lenguas, y si la metodología de evaluación construida para el inglés nos está engañando sobre lo que hacen los modelos en todo lo demás.
Fung lideró el artículo de 2023 "Multitask, Multilingual, Multimodal Evaluation of ChatGPT": uno de los primeros estudios empíricos sistemáticos de un LLM sometido simultáneamente a tareas de razonamiento, alucinación e interactividad en varias lenguas. Los hallazgos no dejaban bien al campo: los resultados de evaluación en inglés sobreestimaban de forma consistente la competencia del modelo en lenguas de menores recursos, donde los mismos prompts producían una calidad de razonamiento claramente peor y tasas de alucinación más altas. Para ai100, que audita motores de IA en cinco regiones lingüísticas, esta es la demostración publicada más clara de por qué la evaluación idioma por idioma es una exigencia metodológica, no una extensión opcional de una línea base en inglés.