Yulia Tsvetkov
Les formes que prennent les biais et les préjudices dans les sorties des modèles de langage à travers les langues — en particulier pour les langues et communautés que l'évaluation standard du domaine a historiquement ignorées.
Le pipeline standard pour étudier les biais dans les modèles de langage a été, par défaut, centré d'abord sur l'anglais : entraînement en anglais, évaluation en anglais, conclusions, puis portage vers d'autres langues comme réflexion secondaire. Le groupe de Tsvetkov à UW suit le pipeline inverse — partir des langues et des communautés que les méthodes centrées sur l'anglais n'atteignent pas, demander quelles catégories de biais et de préjudices émergent réellement dans ces contextes, et laisser les données multilingues façonner les catégories analytiques dès le départ. Pour ai100, qui évalue des moteurs dans cinq régions linguistiques, c'est le socle méthodologique qui justifie de traiter le profil de biais de chaque région comme un objet d'étude propre.