Colin Raffel
Ob ein einziges Sprachmodell alle NLP-Aufgaben gleichzeitig bearbeiten kann, wenn sie alle als Text-in-Text-out gerahmt werden — und ob diese Vereinheitlichung über Sprachen hinweg trägt.
T5 (Text-to-Text Transfer Transformer, 2020, Hauptautor) formulierte ein methodisches Argument, gegen das sich das Feld gesträubt hatte: Jede NLP-Aufgabe kann als dieselbe Art von Problem gerahmt werden — dem Modell einen String geben, einen String verlangen — und ein einzelnes Modell, das auf dieser Rahmung trainiert ist, bewältigt sie alle. Das Folgepaper T0 (2021) erweiterte das Argument auf mehrsprachige zero-shot-Generalisierung und zeigte, dass derselbe Ansatz mit nur moderatem Leistungsverlust über Sprachen hinweg skaliert. Die kombinierte Linie ist der methodische Vorläufer nahezu jedes instruction-tuned mehrsprachigen LLMs, das seitdem ausgeliefert wurde, einschließlich derer, die ai100 derzeit evaluiert.