Die meiste NLP-Evaluation ist einmalig: Ein Benchmark erscheint, wird gesättigt, wird ersetzt. Monz organisiert seit über einem Jahrzehnt die Findings of the WMT-Kampagnen mit und erzeugt damit einen der wenigen Datensätze im Feld mit longitudinaler Struktur — dieselbe Übersetzungsaufgabe, bewertet nach demselben Protokoll, über dieselben Sprachpaare hinweg, Jahr für Jahr. Die akkumulierte Aufzeichnung zeigt, was tatsächlich aus der alten statistischen MT-Ära in die neuronale Ära und weiter in die LLM-Ära übertragen wurde, und wo MT-Fortschritt trotz des Eindrucks universeller Verbesserung stagniert.

Lesenswert, wenn
man Bewertungsmethodik will, die über ein Jahrzehnt wiederholter jährlicher Anwendung validiert wurde — statt eines Benchmarks, der sechs Monate alt ist.
Themen
jährliche Evaluation maschineller Übersetzung (WMT findings); longitudinale Nachverfolgung von MT-Fortschritt über Sprachpaare hinweg; die methodische Linie von statistischer über neuronale MT bis zur MT der LLM-Ära.
Zentrale Arbeiten
Mitorganisation der Findings of the WMT (jährlich, seit 2008); Publikationen des UvA Language Technology Lab zu multilingualer MT; laufende Arbeit zu neuronaler MT-Methodik.