La plupart des évaluations en NLP sont ponctuelles : un benchmark apparaît, se sature, puis est remplacé. Monz co-organise les Findings of the WMT campaigns depuis plus d'une décennie, produisant l'un des rares jeux de données du domaine dotés d'une structure longitudinale — la même tâche de traduction, évaluée par le même protocole, sur les mêmes paires de langues, année après année. Le registre accumulé montre ce qui a réellement été transféré de l'ancienne ère de la traduction automatique statistique à l'ère neuronale puis à l'ère des LLM, et là où le progrès en traduction automatique a stagné malgré l'impression d'amélioration universelle.

À lire lorsque
vous voulez une méthodologie d'évaluation validée par une décennie d'application annuelle répétée — plutôt qu'un benchmark vieux de six mois.
Thèmes
évaluation annuelle de la traduction automatique (WMT findings); suivi longitudinal du progrès en traduction automatique à travers les paires de langues; lignée méthodologique de l'ère statistique à l'ère neuronale puis à l'ère LLM de la traduction automatique.
Travaux clés
co-organisation des Findings of the WMT (annuel, depuis 2008); publications de l'UvA Language Technology Lab sur la traduction automatique multilingue; travaux en cours sur la méthodologie de la traduction automatique neuronale.