Chris Callison-Burch
Ob menschliche Leser Text, den ein Sprachmodell erzeugt hat, von Text unterscheiden können, den Menschen verfasst haben — und wie diese Unterscheidbarkeit abnimmt, wenn Modelle besser werden.
Callison-Burchs Forschungslinie „Real or Fake Text?“ (mit Liam Dugan und anderen, 2020er) führte interaktive Experimente durch, in denen Leser die Stelle in einem Text markieren sollten, an der der menschliche Autor aufhörte und eine KI-Fortsetzung begann. Die Ergebnisse haben den Fortschritt von LLMs aus einem Blickwinkel nachgezeichnet, den die meisten Evaluationen überspringen — bis 2020 war der Übergangspunkt leicht zu finden; 2023 hatten Leser Mühe, ihn überhaupt zu finden, selbst wenn sie motiviert waren. Seine frühere Arbeit etablierte Crowdsourcing als primäres Instrument der NLP-Evaluation; das gibt der aktuellen Linie zusätzliches Gewicht: Er ist ungewöhnlich qualifiziert, zu sagen, was menschliche Evaluatoren unter realistischen Bedingungen erkennen können und was nicht.