Линия исследований Callison-Burch "Real or Fake Text?" (с Liam Dugan и другими, 2020-е) проводила интерактивные эксперименты, где читателей просили отметить точку в тексте, где человеческий автор остановился и началось AI-продолжение. Результаты отслеживали прогресс LLM с угла, который большинство оценок пропускает: в 2020 году границу было легко найти; к 2023 году читатели уже с трудом находили её вообще, даже когда были мотивированы. Его более ранняя работа была пионерской в использовании краудсорсинга как основного инструмента оценки NLP, и это придаёт нынешней линии дополнительный вес: он необычно хорошо подготовлен к тому, чтобы говорить, что человеческие оценщики могут и не могут обнаружить в реалистичных условиях.

Стоит читать, когда
вам нужно спроектировать человеческую оценку LLM-сгенерированного текста и нужна методология, основанная на том, что люди действительно замечают, а не на том, что им кажется, будто они замечают.
Темы
различимость AI-текста и человеческого текста для людей; методология краудсорсинга для оценки NLP; линия оценки машинного перевода из статистической эпохи.
Ключевые работы
линия экспериментов "Real or Fake Text?" о различимости человеческого и AI-текста (с 2020 года); методологические статьи о краудсорсинге для NLP (начало 2010-х); вклад в оценку машинного перевода эпохи WMT.