Mohit Bansal
La question de savoir si les méthodes utilisées pour évaluer des modèles strictement textuels fonctionnent encore lorsque le même modèle doit traiter simultanément des images, de la parole ou d'autres modalités — et ce qui échoue en premier lorsque les modalités sont combinées.
Le MURGe-Lab de Bansal à UNC a produit l'une des lignes de recherche les plus soutenues sur l'évaluation multimodale — raisonnement vision-langage, fidélité (à la source) de la synthèse, évaluation de la génération longue — à un rythme tel que la plupart des articles du laboratoire identifient un mode de défaillance précis dans la méthodologie d'évaluation existante et proposent un remplacement. L'ensemble des travaux compte plus que n'importe quel article isolé : il a façonné ce que les générations suivantes d'articles sur l'évaluation multimodale considèrent comme rigoureux. Pour ai100, la question de savoir comment évaluer le comportement de mention de marque dans des modèles qui traitent aussi des images (graphiques, photos de produits, captures d'écran) est précisément la question d'évaluation multimodale que le groupe de Bansal défriche depuis plusieurs années.