Levys „Instruction Induction“-Paper (2022, Seniorautor) kehrte das Standardexperiment zum Befolgen von Instruktionen um: Statt dem Modell eine Instruktion zu geben und zu beobachten, ob es sie befolgt, gibt man ihm einige Eingabe-Ausgabe-Beispiele und bittet das Modell zu formulieren, welche Instruktion diese Beispiele implizieren. Die Befunde waren zugleich ermutigend und beunruhigend — moderne LLMs können aus einer Handvoll Beispielen für viele Aufgaben plausible Instruktionen induzieren, was nahelegt, dass ihre interne Repräsentation von „Aufgabe“ tatsächlich abstrakt ist; sie induzieren aber bisweilen Instruktionen, die subtil von der menschlich beabsichtigten abweichen und dadurch nachgelagertes Verhalten beeinflussen. Für ai100 ist das wichtig, weil die meisten Engine-Anfragen keine explizite Instruktion enthalten — die Engine erschließt die Aufgabe implizit aus dem Kontext, und diese Inferenz kann anders ausfallen als erwartet.

Lesenswert, wenn
man den Schritt der impliziten Instruktionsinferenz verstehen will, der stattfindet, bevor ein LLM eine Antwort erzeugt, besonders wenn die Nutzeranfrage unterspezifiziert ist.
Themen
Instruktionsinduktion aus Beispielen; was implizite Instruktionsinferenz über Modellrepräsentationen verrät; die LIMA / Less Is More for Alignment-Forschungslinie.
Zentrale Arbeiten
Instruction Induction (2022, Seniorautor); LIMA: Less Is More for Alignment (2023, Mitautor); grundlegende Arbeit zu neuronalen Wort-Embeddings (mit Goldberg, 2014).