Self-Instruct (2022, auteur senior) a montré qu'un LLM peut générer les données d'instruction-tuning nécessaires pour s'améliorer lui-même : amorcer le modèle avec quelques exemples de triplets (instruction, entrée, sortie), lui demander d'en générer d'autres sur le même schéma, filtrer selon la qualité, puis utiliser le résultat comme données d'entraînement. La technique a été immédiatement adoptée dans toute l'industrie — la plupart des LLM actuels réglés par instruction ont été entraînés sur des données de ce type, souvent générées par GPT-3 ou GPT-4. La conséquence méthodologique pour l'évaluation est inconfortable : lorsque des modèles entraînés sur des données synthétiques issues de modèles plus anciens sont évalués par des juges qui sont eux aussi des modèles de langage, toute la boucle d'évaluation devient de plus en plus endogène à la même famille de systèmes que l'on mesure.

À lire lorsque
vous voulez réfléchir sérieusement à la méthodologie d'évaluation à une époque où les données d'entraînement, les juges et les systèmes évalués proviennent tous de lignées de modèles apparentées.
Thèmes
données d'instruction-tuning autogénérées (Self-Instruct); conséquences méthodologiques des données d'entraînement générées par LLM; long arc du NLP par prédiction structurée.
Travaux clés
Self-Instruct (2022, auteur senior); travaux au long cours sur le NLP probabiliste et par prédiction structurée; publications en cours de UW et AI2 sur le développement responsable des LLM.