T5 (Text-to-Text Transfer Transformer, 2020, ведущий автор) сделал методологический аргумент, которому область сопротивлялась: любую NLP-задачу можно сформулировать как задачу одного типа — дать модели строку и попросить строку, — и одна модель, обученная в такой рамке, справляется со всеми. Следующая статья T0 (2021) расширила этот аргумент до мультиязычного zero-shot обобщения, показав, что тот же подход масштабируется между языками лишь с умеренной потерей качества. Вместе эта линия стала методологическим предшественником почти каждой instruction-tuned мультиязычной LLM, поставляемой с тех пор, включая те, которые ai100 сейчас оценивает.

Стоит читать, когда
вы хотите понять архитектурные решения и выбор обучающих данных, которые сделали возможным мультиязычное zero-shot обобщение, — и что эти решения означают для методологии оценки.
Темы
единое text-to-text представление NLP-задач (T5); мультиязычное zero-shot обобщение (T0); линия от исследовательских моделей к развёрнутым мультиязычным LLM.
Ключевые работы
T5: Text-to-Text Transfer Transformer (2020, ведущий автор); T0 multitask-prompted multilingual generalization (2021, соавтор); продолжающиеся публикации о запоминании моделями и атрибуции датасетов.