Rosso organisiert seit zwei Jahrzehnten Evaluationskampagnen aus der spanischsprachigen NLP-Community heraus: IberLEF für die iberischen Sprachen, PAN für Plagiats- und Autorenschaftsprobleme über Sprachen hinweg sowie eine lange Reihe von Shared Tasks zu Autorprofiling, Ironieerkennung, Hate-Speech-Analyse und Desinformation. Der substanzielle Wert liegt darin, dass die Aufgaben mit muttersprachlicher Sensibilität dafür entworfen wurden, welche sprachlichen und kulturellen Merkmale tatsächlich Signal tragen — Ironie im Spanischen ist nicht die Ironie englischsprachiger Datensätze, und Hate-Speech-Kategorien verschieben sich mit regulatorischem und kulturellem Kontext. Für ai100, das das Verhalten einer Engine auf Spanisch als eines seiner fünf Sprachaudits evaluiert, ist dies der nächstliegende Vorläufer für sprachraumspezifische Evaluation, die über Jahre hinweg diszipliniert betrieben wurde.

Lesenswert, wenn
man Sprachmodellverhalten in iberoromanischen Sprachen mit einer Methodik evaluieren muss, die für diese Sprachen entwickelt wurde, nicht aus dem Englischen adaptiert.
Themen
sprachraumspezifische Evaluationskampagnen (IberLEF, PAN); Ironie-, Hate-Speech- und Desinformationserkennung in spanischsprachigen Umgebungen; mehrjährige Shared-Task-Organisation als Forschungspraxis.
Zentrale Arbeiten
IberLEF-Evaluationskampagnen (seit 2018, Mitorganisator); langjährige PAN-Mitorganisation mit Stein und Potthast (seit 2009); UPV-PRHLT-Veröffentlichungen zu mehrsprachiger NLP-Evaluation.