Mohit Bansal
Продолжают ли работать методы, которыми мы оцениваем модели только для текста, когда той же модели приходится одновременно обрабатывать изображения, речь или другие модальности, — и что ломается первым при их объединении.
MURGe-Lab Bansal в UNC создала одну из наиболее устойчивых исследовательских линий по мультимодальной оценке — визуально-языковое рассуждение, верность источнику в суммаризации, оценка длинной генерации — причём в таком темпе, что большинство статей лаборатории выделяет конкретный режим отказа существующей методологии оценки и предлагает замену. Важнее не отдельная статья, а корпус работ: он сформировал то, что последующие поколения статей по мультимодальной оценке считают строгим. Для ai100 вопрос о том, как оценивать поведение упоминаний брендов в моделях, которые также обрабатывают изображения — графики, фото продуктов, скриншоты, — ровно та самая задача мультимодальной оценки, которую группа Bansal уже несколько лет выделяет как самостоятельную.