Self-Instruct (2022, Seniorautor) zeigte, dass ein LLM die Instruction-Tuning-Daten erzeugen kann, die es braucht, um sich selbst zu verbessern: Man promptet das Modell mit einigen Seed-Beispielen von (instruction, input, output)-Tupeln, lässt es weitere im selben Muster erzeugen, filtert nach Qualität und nutzt das Ergebnis als Trainingsdaten. Die Technik wurde sofort in der Industrie übernommen — die meisten heutigen instruction-tuned LLMs wurden auf Daten dieser Art trainiert, vieles davon von GPT-3 oder GPT-4 erzeugt. Die methodische Konsequenz für Evaluation ist unangenehm: Wenn Modelle, die auf synthetischen Daten älterer Modelle trainiert wurden, von Richtern evaluiert werden, die ebenfalls Sprachmodelle sind, wird die gesamte Evaluationsschleife zunehmend endogen gegenüber derselben Familie von Systemen, die gemessen werden.

Lesenswert, wenn
man sorgfältig über Evaluationsmethodik in einer Ära nachdenken will, in der Trainingsdaten, Richter und die evaluierten Systeme selbst alle aus verwandten Modelllinien stammen.
Themen
selbstgenerierte Instruction-Tuning-Trainingsdaten (Self-Instruct); methodische Folgen LLM-generierter Trainingsdaten; der lange Bogen des Structured-Prediction-NLP.
Zentrale Arbeiten
Self-Instruct (2022, Seniorautor); langjähriges Werk zu Structured-Prediction und probabilistischem NLP; laufende Publikationen von UW und AI2 zu verantwortlicher LLM-Entwicklung.