Bansals MURGe-Lab bei UNC hat eine der nachhaltigeren Forschungslinien zur multimodalen Evaluation hervorgebracht — Vision-Language-Reasoning, Quellentreue von Zusammenfassungen, Bewertung langer generierter Texte — in einem Tempo, bei dem die meisten Arbeiten des Labs einen spezifischen Fehlermodus bestehender Bewertungsmethodik identifizieren und einen Ersatz vorschlagen. Der Werkkomplex zählt mehr als jede einzelne Arbeit: Er hat geprägt, was spätere Generationen von Arbeiten zur multimodalen Evaluation als rigoros betrachten. Für ai100 ist die Frage, wie man das Verhalten bei Marken-Nennungen in Modellen evaluiert, die auch Bilder verarbeiten (Diagramme, Produktfotos, Screenshots), genau die Frage multimodaler Evaluation, die Bansals Gruppe seit mehreren Jahren herausarbeitet.

Lesenswert, wenn
man ein multimodales Sprachmodell evaluieren muss und Methodik will, die aus dem längeren Bogen der Forschung zur multimodalen Evaluation informiert ist, statt aus Ad-hoc-Erweiterungen textbasierter Metriken.
Themen
Methodik multimodaler Evaluation (Vision-Language und darüber hinaus); Bewertung der Quellentreue von Zusammenfassungen; die methodische Praxis, Fehlermodi zu identifizieren, bevor man Metriken vorschlägt.
Zentrale Arbeiten
Werkkomplex des MURGe-Lab zu multimodaler Evaluation und logischem Schließen (Reasoning) (UNC, seit 2018); Forschungslinie zur Quellentreue von Zusammenfassungen; Publikationen des ENGAGE NSF-AI Institute zu multimodaler KI.