La lignée "Real or Fake Text?" de Callison-Burch (avec Liam Dugan et d'autres, années 2020) a mené des expériences interactives où l'on demandait à des lecteurs de marquer le point d'un texte où l'auteur humain s'arrêtait et où une continuation par IA commençait. Les résultats ont suivi les progrès des LLM depuis un angle que la plupart des évaluations négligent — jusqu'en 2020, le point de coupure était facile à trouver ; en 2023, les lecteurs peinaient à le repérer, même lorsqu'ils étaient motivés. Ses travaux antérieurs ont fait du crowdsourcing un instrument primaire de l'évaluation NLP, ce qui donne un poids supplémentaire à la ligne actuelle : il est particulièrement qualifié pour dire ce que les évaluateurs humains peuvent et ne peuvent pas détecter dans des conditions réalistes.

À lire lorsque
vous devez concevoir une évaluation humaine de texte généré par LLM et voulez une méthodologie informée par ce que les humains remarquent réellement, par opposition à ce qu'ils pensent remarquer.
Thèmes
distinguabilité humaine du texte IA vs humain; méthodologie de crowdsourcing pour l'évaluation NLP; lignée d'évaluation de la traduction automatique depuis l'ère statistique.
Travaux clés
lignée d'expériences "Real or Fake Text?" sur la distinguabilité humain-vs-IA (depuis 2020); articles méthodologiques sur le crowdsourcing pour le NLP (début des années 2010); contributions de l'ère WMT à l'évaluation de la traduction automatique.