Christof Monz
Evaluación sistemática año tras año de la traducción automática entre decenas de pares lingüísticos — y qué revela ese seguimiento sobre qué problemas de traducción se están resolviendo y cuáles no.
La mayoría de la evaluación en NLP es de una sola vez: aparece un benchmark, se satura, se reemplaza. Monz lleva más de una década coorganizando los Findings of the WMT campaigns, produciendo uno de los pocos conjuntos de datos del campo con estructura longitudinal: la misma tarea de traducción, evaluada por el mismo protocolo, entre los mismos pares lingüísticos, año tras año. El registro acumulado muestra qué se transfirió realmente de la antigua era estadística de la traducción automática a la era neuronal y a la era LLM, y dónde el progreso en traducción automática se ha estancado pese a la impresión de mejora universal.