Chris Callison-Burch
Si les lecteurs humains peuvent distinguer un texte produit par un modèle de langage d'un texte produit par des humains — et comment cette distinguabilité diminue à mesure que les modèles s'améliorent.
La lignée "Real or Fake Text?" de Callison-Burch (avec Liam Dugan et d'autres, années 2020) a mené des expériences interactives où l'on demandait à des lecteurs de marquer le point d'un texte où l'auteur humain s'arrêtait et où une continuation par IA commençait. Les résultats ont suivi les progrès des LLM depuis un angle que la plupart des évaluations négligent — jusqu'en 2020, le point de coupure était facile à trouver ; en 2023, les lecteurs peinaient à le repérer, même lorsqu'ils étaient motivés. Ses travaux antérieurs ont fait du crowdsourcing un instrument primaire de l'évaluation NLP, ce qui donne un poids supplémentaire à la ligne actuelle : il est particulièrement qualifié pour dire ce que les évaluateurs humains peuvent et ne peuvent pas détecter dans des conditions réalistes.