Yulia Tsvetkov
Qué formas adoptan el sesgo y el daño en las salidas de modelos de lenguaje a través de idiomas, especialmente en las lenguas y comunidades que la evaluación estándar del campo ha ignorado históricamente.
El pipeline estándar para estudiar sesgos en modelos de lenguaje ha sido centrado primero en el inglés por defecto: entrenar en inglés, evaluar en inglés, extraer conclusiones y luego portar a otros idiomas como ocurrencia tardía. El grupo de Tsvetkov en UW ejecuta el pipeline inverso: empezar por las lenguas y comunidades a las que no llegan los métodos anglocéntricos, preguntar qué categorías de sesgo y daño emergen realmente en esos entornos y dejar que los datos multilingües moldeen desde el inicio las categorías analíticas. Para ai100, que evalúa motores en cinco regiones lingüísticas, este es el respaldo metodológico para tratar el perfil de sesgo de cada entorno lingüístico como su propio objeto de estudio.