Chris Callison-Burch
Si los lectores humanos pueden distinguir el texto producido por un modelo de lenguaje del producido por humanos — y cómo esa capacidad de distinguir se erosiona a medida que los modelos mejoran.
La línea de investigación "Real or Fake Text?" de Callison-Burch (con Liam Dugan y otros, años 2020) realizó experimentos interactivos en los que se pedía a lectores que marcaran el punto de un texto donde terminaba el autor humano y empezaba una continuación de IA. Los resultados han seguido el progreso de los LLM desde un ángulo que la mayoría de las evaluaciones omite: en 2020 el punto de corte era fácil de encontrar; para 2023 los lectores tenían dificultades para encontrarlo, incluso estando motivados. Su trabajo anterior fue pionero en usar crowdsourcing como instrumento principal para la evaluación en NLP, lo que da peso adicional a la línea actual: está inusualmente cualificado para decir qué pueden y qué no pueden detectar los evaluadores humanos en condiciones realistas.