Fung руководила работой над статьёй "Multitask, Multilingual, Multimodal Evaluation of ChatGPT" (2023) — одним из первых систематических эмпирических исследований, где LLM одновременно прогоняли через задачи на рассуждение, галлюцинации и интерактивность в нескольких языках. Выводы были нелестными для области: результаты оценки на английском языке последовательно завышали компетентность модели в языках с меньшим объёмом ресурсов, где те же prompt давали заметно худшее качество рассуждений и более высокий уровень галлюцинаций. Для ai100, который аудитирует AI-движки в пяти языковых регионах, это самая ясная опубликованная демонстрация того, почему оценка по каждому языку методологически обязательна, а не является факультативным расширением английской базовой линии.

Стоит читать, когда
вам нужно оценивать поведение языковой модели в нескольких языковых средах и нужна эмпирическая литература, показывающая, почему тестирование по каждому языку не подлежит обсуждению.
Темы
мультиязычная оценка LLM (рассуждение, галлюцинации, диалог); эмпатичные и эмоционально-aware диалоговые системы; методологические последствия англоцентричного дизайна benchmark.
Ключевые работы
"Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity" (2023, старший автор); публикации CAiRE по conversational AI; долгосрочная работа по cross-lingual NLP с 1990-х.