← Назад к списку
Shafiq Joty
Методология оценки языковых моделей, когда контекст применения — корпоративное ПО, а не исследовательская демонстрация.
Более ранние опубликованные работы Joty посвящены парсингу структуры дискурса — той области NLP, где спрашивают, держится ли абзац как аргумент, а не только правильно ли разбирается каждое предложение. Эта привычка переносится в его более поздние публикации по оценке LLM: корпоративное LLM-приложение должно производить результаты, сохраняющие аргументативную форму в многоходовом использовании, а стандартные benchmarks для одношаговых сценариев этого не фиксируют. Этот корпус работ звучит как постоянное напоминание: «модель проходит benchmark» и «модель выдерживает корпоративный трафик» — не одно и то же утверждение.