Self-Instruct (2022, старший автор) показал, что LLM может генерировать данные для instruction-tuning, необходимые, чтобы улучшать саму себя: дать модели несколько затравочных примеров кортежей (instruction, input, output), попросить её сгенерировать больше в той же схеме, отфильтровать по качеству и использовать результат как обучающие данные. Техника была немедленно подхвачена индустрией: большинство нынешних instruction-tuned LLM обучались на данных такого рода, значительная часть которых была сгенерирована GPT-3 или GPT-4. Методологическое последствие для оценки неприятно: когда модели, обученные на синтетических данных от более старых моделей, оцениваются судьями, которые сами являются языковыми моделями, весь контур оценки становится всё более эндогенным той же семье систем, которую он измеряет.

Стоит читать, когда
вы хотите аккуратно думать о методологии оценки в эпоху, когда обучающие данные, судьи и оцениваемые системы происходят из родственных модельных линий.
Темы
самогенерируемые данные для instruction-tuning (Self-Instruct); методологические последствия обучающих данных, сгенерированных LLM; длинная дуга NLP со структурным предсказанием.
Ключевые работы
Self-Instruct (2022, старший автор); большая линия работ по структурному предсказанию и вероятностному NLP; продолжающиеся публикации UW и AI2 по ответственной разработке LLM.