Pascale Fung
Выполняет ли одна и та же языковая модель одну и ту же работу в разных языках — и не вводит ли нас в заблуждение методология оценки, построенная для английского, относительно того, что модели делают во всём остальном.
Fung руководила работой над статьёй "Multitask, Multilingual, Multimodal Evaluation of ChatGPT" (2023) — одним из первых систематических эмпирических исследований, где LLM одновременно прогоняли через задачи на рассуждение, галлюцинации и интерактивность в нескольких языках. Выводы были нелестными для области: результаты оценки на английском языке последовательно завышали компетентность модели в языках с меньшим объёмом ресурсов, где те же prompt давали заметно худшее качество рассуждений и более высокий уровень галлюцинаций. Для ai100, который аудитирует AI-движки в пяти языковых регионах, это самая ясная опубликованная демонстрация того, почему оценка по каждому языку методологически обязательна, а не является факультативным расширением английской базовой линии.