El MURGe-Lab de Bansal en UNC ha producido una de las líneas de investigación más sostenidas sobre evaluación multimodal —razonamiento visión-lenguaje, evaluación de la fidelidad (a la fuente) en resúmenes, evaluación de generación de formato largo— a un ritmo en el que la mayoría de los artículos del laboratorio identifican un modo de fallo específico en la metodología de evaluación existente y proponen un reemplazo. La trayectoria importa más que cualquier artículo individual: ha moldeado lo que generaciones posteriores de artículos sobre evaluación multimodal consideran riguroso. Para ai100, la pregunta de cómo evaluar el comportamiento de mención de marcas en modelos que también procesan imágenes (gráficos, fotos de productos, capturas de pantalla) es precisamente la pregunta de evaluación multimodal que el grupo de Bansal lleva varios años delimitando.

Vale la pena seguirlo cuando
se necesita evaluar un modelo de lenguaje multimodal y se quiere metodología informada por el arco más largo de investigación en evaluación multimodal, no extensiones ad hoc de métricas solo de texto.
Temas
metodología de evaluación multimodal (visión-lenguaje y más allá); evaluación de la fidelidad (a la fuente) en resúmenes; práctica metodológica de identificar modos de fallo antes de proponer métricas.
Obras clave
trayectoria de publicaciones de MURGe-Lab sobre evaluación y razonamiento multimodales (UNC, 2018 en adelante); línea de investigación sobre fidelidad (a la fuente) en resúmenes; publicaciones del ENGAGE NSF-AI Institute sobre IA multimodal.