Noah A. Smith
Может ли языковая модель производить собственные обучающие данные — и каковы методологические последствия, когда это становится стандартной практикой.
Self-Instruct (2022, старший автор) показал, что LLM может генерировать данные для instruction-tuning, необходимые, чтобы улучшать саму себя: дать модели несколько затравочных примеров кортежей (instruction, input, output), попросить её сгенерировать больше в той же схеме, отфильтровать по качеству и использовать результат как обучающие данные. Техника была немедленно подхвачена индустрией: большинство нынешних instruction-tuned LLM обучались на данных такого рода, значительная часть которых была сгенерирована GPT-3 или GPT-4. Методологическое последствие для оценки неприятно: когда модели, обученные на синтетических данных от более старых моделей, оцениваются судьями, которые сами являются языковыми моделями, весь контур оценки становится всё более эндогенным той же семье систем, которую он измеряет.