Более ранние опубликованные работы Joty посвящены парсингу структуры дискурса — той области NLP, где спрашивают, держится ли абзац как аргумент, а не только правильно ли разбирается каждое предложение. Эта привычка переносится в его более поздние публикации по оценке LLM: корпоративное LLM-приложение должно производить результаты, сохраняющие аргументативную форму в многоходовом использовании, а стандартные benchmarks для одношаговых сценариев этого не фиксируют. Этот корпус работ звучит как постоянное напоминание: «модель проходит benchmark» и «модель выдерживает корпоративный трафик» — не одно и то же утверждение.

Стоит читать, когда
вам нужна перспектива оценки, сформированная тем, чего методологически требует выпуск LLM-функций для корпоративных клиентов.
Темы
структура дискурса как линза для длинных результатов LLM; многоходовая оценка за пределами benchmarks для одношаговых сценариев; разрыв между исследовательскими benchmarks и корпоративным развёртыванием.
Ключевые работы
более ранние основополагающие работы по парсингу дискурса (RST и далее); текущие публикации по многоходовой оценке LLM и надёжности.