Colin Raffel
Может ли одна языковая модель выполнять все NLP-задачи сразу, если все они сформулированы как «текст на вход — текст на выход», — и сохраняется ли это объединение между языками.
T5 (Text-to-Text Transfer Transformer, 2020, ведущий автор) сделал методологический аргумент, которому область сопротивлялась: любую NLP-задачу можно сформулировать как задачу одного типа — дать модели строку и попросить строку, — и одна модель, обученная в такой рамке, справляется со всеми. Следующая статья T0 (2021) расширила этот аргумент до мультиязычного zero-shot обобщения, показав, что тот же подход масштабируется между языками лишь с умеренной потерей качества. Вместе эта линия стала методологическим предшественником почти каждой instruction-tuned мультиязычной LLM, поставляемой с тех пор, включая те, которые ai100 сейчас оценивает.