La línea de investigación "Real or Fake Text?" de Callison-Burch (con Liam Dugan y otros, años 2020) realizó experimentos interactivos en los que se pedía a lectores que marcaran el punto de un texto donde terminaba el autor humano y empezaba una continuación de IA. Los resultados han seguido el progreso de los LLM desde un ángulo que la mayoría de las evaluaciones omite: en 2020 el punto de corte era fácil de encontrar; para 2023 los lectores tenían dificultades para encontrarlo, incluso estando motivados. Su trabajo anterior fue pionero en usar crowdsourcing como instrumento principal para la evaluación en NLP, lo que da peso adicional a la línea actual: está inusualmente cualificado para decir qué pueden y qué no pueden detectar los evaluadores humanos en condiciones realistas.

Vale la pena seguirlo cuando
se necesita diseñar evaluación humana de texto generado por LLM y se quiere una metodología informada por lo que los humanos realmente notan frente a lo que creen notar.
Temas
capacidad humana de distinguir texto de IA frente a texto humano; metodología de crowdsourcing para evaluación en NLP; linaje de evaluación de traducción automática desde la era estadística.
Obras clave
línea de experimentos "Real or Fake Text?" sobre distinguibilidad humano-vs-IA (2020 en adelante); artículos de metodología de crowdsourcing para NLP (principios de la década de 2010); contribuciones de la era WMT a la evaluación de traducción automática.