T5 (Text-to-Text Transfer Transformer, 2020, Hauptautor) formulierte ein methodisches Argument, gegen das sich das Feld gesträubt hatte: Jede NLP-Aufgabe kann als dieselbe Art von Problem gerahmt werden — dem Modell einen String geben, einen String verlangen — und ein einzelnes Modell, das auf dieser Rahmung trainiert ist, bewältigt sie alle. Das Folgepaper T0 (2021) erweiterte das Argument auf mehrsprachige zero-shot-Generalisierung und zeigte, dass derselbe Ansatz mit nur moderatem Leistungsverlust über Sprachen hinweg skaliert. Die kombinierte Linie ist der methodische Vorläufer nahezu jedes instruction-tuned mehrsprachigen LLMs, das seitdem ausgeliefert wurde, einschließlich derer, die ai100 derzeit evaluiert.

Lesenswert, wenn
man die Architektur- und Trainingsdatenentscheidungen verstehen will, die mehrsprachige zero-shot-Generalisierung möglich gemacht haben — und was diese Entscheidungen für Bewertungsmethodik bedeuten.
Themen
einheitliche Text-to-Text-Rahmung von NLP-Aufgaben (T5); mehrsprachige zero-shot-Generalisierung (T0); die Linie von Forschungsmodellen zu eingesetzten mehrsprachigen LLMs.
Zentrale Arbeiten
T5: Text-to-Text Transfer Transformer (2020, Hauptautor); T0 multitask-prompted multilingual generalization (2021, Mitautor); laufende Veröffentlichungen zu Modellmemorierung und Datensatzattribution.