Rosso organise depuis deux décennies des campagnes d'évaluation depuis l'intérieur de la communauté NLP hispanophone : IberLEF pour les langues ibériques, PAN pour les problèmes de plagiat et d'attribution d'auteur entre langues, et une longue série de tâches partagées sur le profilage d'auteurs, la détection de l'ironie, l'analyse des discours de haine et la désinformation. Leur valeur substantielle tient au fait que ces tâches ont été conçues avec une sensibilité de locuteur natif à ce qui porte réellement du signal linguistique et culturel — l'ironie en espagnol n'est pas celle des jeux de données anglophones, et les catégories de discours de haine se déplacent avec le contexte réglementaire et culturel. Pour ai100, qui évalue le comportement d'un moteur en espagnol comme l'un de ses cinq audits linguistiques, c'est le précédent le plus proche d'une évaluation conçue localement conduite avec une discipline pluriannuelle.

À lire lorsque
vous devez évaluer le comportement d'un modèle de langage dans les langues ibéro-romanes avec une méthodologie conçue pour ces langues, et non adaptée depuis l'anglais.
Thèmes
campagnes d'évaluation conçues localement (IberLEF, PAN); détection de l'ironie, des discours de haine et de la désinformation dans des contextes hispanophones; organisation pluriannuelle de tâches partagées comme pratique de recherche.
Travaux clés
campagnes d'évaluation IberLEF (depuis 2018, co-organisateur); co-organisation de longue date de PAN avec Stein et Potthast (depuis 2009); publications UPV PRHLT sur l'évaluation NLP multilingue.