Mohit Bansal
Ob die Methoden, mit denen wir reine Sprachmodelle evaluieren, noch funktionieren, wenn dasselbe Modell gleichzeitig Bilder, gesprochene Sprache oder andere Modalitäten verarbeiten muss — und was zuerst versagt, wenn Modalitäten kombiniert werden.
Bansals MURGe-Lab bei UNC hat eine der nachhaltigeren Forschungslinien zur multimodalen Evaluation hervorgebracht — Vision-Language-Reasoning, Quellentreue von Zusammenfassungen, Bewertung langer generierter Texte — in einem Tempo, bei dem die meisten Arbeiten des Labs einen spezifischen Fehlermodus bestehender Bewertungsmethodik identifizieren und einen Ersatz vorschlagen. Der Werkkomplex zählt mehr als jede einzelne Arbeit: Er hat geprägt, was spätere Generationen von Arbeiten zur multimodalen Evaluation als rigoros betrachten. Für ai100 ist die Frage, wie man das Verhalten bei Marken-Nennungen in Modellen evaluiert, die auch Bilder verarbeiten (Diagramme, Produktfotos, Screenshots), genau die Frage multimodaler Evaluation, die Bansals Gruppe seit mehreren Jahren herausarbeitet.