La mayoría de la evaluación en NLP es de una sola vez: aparece un benchmark, se satura, se reemplaza. Monz lleva más de una década coorganizando los Findings of the WMT campaigns, produciendo uno de los pocos conjuntos de datos del campo con estructura longitudinal: la misma tarea de traducción, evaluada por el mismo protocolo, entre los mismos pares lingüísticos, año tras año. El registro acumulado muestra qué se transfirió realmente de la antigua era estadística de la traducción automática a la era neuronal y a la era LLM, y dónde el progreso en traducción automática se ha estancado pese a la impresión de mejora universal.

Vale la pena seguirlo cuando
se quiere metodología de evaluación validada durante una década de aplicación anual repetida — en lugar de un benchmark con seis meses de vida.
Temas
evaluación anual de traducción automática (WMT findings); seguimiento longitudinal del progreso de traducción automática entre pares lingüísticos; linaje metodológico desde la traducción automática estadística a la neuronal y a la era LLM.
Obras clave
coorganización de Findings of the WMT (anual, desde 2008); publicaciones del UvA Language Technology Lab sobre traducción automática multilingüe; trabajo en curso sobre metodología de traducción automática neuronal.