Rosso два десятилетия организует оценочные кампании изнутри испаноязычного NLP-сообщества: IberLEF для иберийских языков, PAN для задач плагиата и авторства на разных языках, а также длинную линию shared tasks по профилированию авторов, детекции иронии, анализу hate speech и дезинформации. Содержательная ценность в том, что задачи проектировались с чувствительностью носителей языка к тому, какие языковые и культурные признаки действительно несут сигнал: ирония в испанском — это не ирония англоязычных датасетов, а категории hate speech сдвигаются вместе с регуляторным и культурным контекстом. Для ai100, который оценивает поведение движка на испанском как один из пяти языковых аудитов, это ближайший прецедент оценки, спроектированной изнутри локали, проводимой с многолетней дисциплиной.

Стоит читать, когда
вам нужно оценивать поведение языковой модели в иберо-романских языках методологией, разработанной для этих языков, а не адаптированной с английского.
Темы
оценочные кампании, спроектированные изнутри языковой локали (IberLEF, PAN); детекция иронии, hate speech и дезинформации в испаноязычных контекстах; многолетняя организация shared tasks как исследовательская практика.
Ключевые работы
оценочные кампании IberLEF (с 2018, соорганизатор); многолетняя соорганизация PAN со Stein и Potthast (с 2009); публикации UPV PRHLT по мультиязычной оценке NLP.