Le MURGe-Lab de Bansal à UNC a produit l'une des lignes de recherche les plus soutenues sur l'évaluation multimodale — raisonnement vision-langage, fidélité (à la source) de la synthèse, évaluation de la génération longue — à un rythme tel que la plupart des articles du laboratoire identifient un mode de défaillance précis dans la méthodologie d'évaluation existante et proposent un remplacement. L'ensemble des travaux compte plus que n'importe quel article isolé : il a façonné ce que les générations suivantes d'articles sur l'évaluation multimodale considèrent comme rigoureux. Pour ai100, la question de savoir comment évaluer le comportement de mention de marque dans des modèles qui traitent aussi des images (graphiques, photos de produits, captures d'écran) est précisément la question d'évaluation multimodale que le groupe de Bansal défriche depuis plusieurs années.

À lire lorsque
vous devez évaluer un modèle de langage multimodal et voulez une méthodologie informée par le long arc de la recherche sur l'évaluation multimodale plutôt que par des extensions ad hoc de métriques textuelles.
Thèmes
méthodologie d'évaluation multimodale (vision-langage et au-delà); évaluation de la fidélité (à la source) dans la synthèse; pratique méthodologique consistant à identifier les modes de défaillance avant de proposer des métriques.
Travaux clés
ensemble de publications du MURGe-Lab sur l'évaluation et le raisonnement multimodaux (UNC, 2018 et après); ligne de recherche sur la fidélité (à la source) des synthèses; publications de l'ENGAGE NSF-AI Institute sur l'IA multimodale.