MURGe-Lab Bansal в UNC создала одну из наиболее устойчивых исследовательских линий по мультимодальной оценке — визуально-языковое рассуждение, верность источнику в суммаризации, оценка длинной генерации — причём в таком темпе, что большинство статей лаборатории выделяет конкретный режим отказа существующей методологии оценки и предлагает замену. Важнее не отдельная статья, а корпус работ: он сформировал то, что последующие поколения статей по мультимодальной оценке считают строгим. Для ai100 вопрос о том, как оценивать поведение упоминаний брендов в моделях, которые также обрабатывают изображения — графики, фото продуктов, скриншоты, — ровно та самая задача мультимодальной оценки, которую группа Bansal уже несколько лет выделяет как самостоятельную.

Стоит читать, когда
вам нужно оценить мультимодальную языковую модель и нужна методология, опирающаяся на более длинную историю исследований мультимодальной оценки, а не на ad-hoc расширения текстовых метрик.
Темы
методология мультимодальной оценки (vision-language и шире); оценка верности источнику в суммаризации; методологическая практика сначала выявлять режимы отказа, а уже потом предлагать метрики.
Ключевые работы
корпус публикаций MURGe-Lab по мультимодальной оценке и рассуждению (UNC, с 2018 года); исследовательская линия по верности источнику в суммаризации; публикации ENGAGE NSF-AI Institute по мультимодальному AI.