Большая часть оценки в NLP одноразова: появляется benchmark, его насыщают, затем заменяют. Monz больше десятилетия соорганизует Findings of the WMT campaigns, создавая один из немногих датасетов в области с продольной структурой: одна и та же задача перевода, оцениваемая по одному и тому же протоколу, на одних и тех же языковых парах, год за годом. Накопленная запись показывает, что действительно перешло из старой статистической эпохи MT в нейронную и затем в эпоху LLM, а где прогресс MT остановился несмотря на впечатление всеобщего улучшения.

Стоит читать, когда
вам нужна методология оценки, проверенная десятилетием повторного ежегодного применения, а не benchmark шестимесячной давности.
Темы
ежегодная оценка машинного перевода (WMT findings); продольное отслеживание прогресса MT по языковым парам; методологическая линия от статистической MT к нейронной и LLM-эпохе.
Ключевые работы
соорганизация Findings of the WMT (ежегодно, с 2008 года); публикации UvA Language Technology Lab по многоязычному MT; текущая работа по методологии нейронного MT.