Christof Monz
L'évaluation systématique, année après année, de la traduction automatique sur des dizaines de paires de langues — et ce que ce suivi révèle des problèmes de traduction qui sont en voie d'être résolus et de ceux qui ne le sont pas.
La plupart des évaluations en NLP sont ponctuelles : un benchmark apparaît, se sature, puis est remplacé. Monz co-organise les Findings of the WMT campaigns depuis plus d'une décennie, produisant l'un des rares jeux de données du domaine dotés d'une structure longitudinale — la même tâche de traduction, évaluée par le même protocole, sur les mêmes paires de langues, année après année. Le registre accumulé montre ce qui a réellement été transféré de l'ancienne ère de la traduction automatique statistique à l'ère neuronale puis à l'ère des LLM, et là où le progrès en traduction automatique a stagné malgré l'impression d'amélioration universelle.