Mohit Bansal
Si los métodos que usamos para evaluar modelos solo de lenguaje siguen funcionando cuando el mismo modelo tiene que manejar imágenes, habla u otras modalidades a la vez, y qué falla primero cuando se combinan modalidades.
El MURGe-Lab de Bansal en UNC ha producido una de las líneas de investigación más sostenidas sobre evaluación multimodal —razonamiento visión-lenguaje, evaluación de la fidelidad (a la fuente) en resúmenes, evaluación de generación de formato largo— a un ritmo en el que la mayoría de los artículos del laboratorio identifican un modo de fallo específico en la metodología de evaluación existente y proponen un reemplazo. La trayectoria importa más que cualquier artículo individual: ha moldeado lo que generaciones posteriores de artículos sobre evaluación multimodal consideran riguroso. Para ai100, la pregunta de cómo evaluar el comportamiento de mención de marcas en modelos que también procesan imágenes (gráficos, fotos de productos, capturas de pantalla) es precisamente la pregunta de evaluación multimodal que el grupo de Bansal lleva varios años delimitando.