Emmanuel Candès
Wie man gültige statistische Unsicherheitsintervalle um die Vorhersagen eines beliebigen Modells legt — einschließlich Sprachmodellen — ohne anzunehmen, welche Fehlerverteilung zu erwarten ist.
Candès ist eine der Gründungsfiguren von Conformal Prediction, einem statistischen Framework, das kalibrierte Vorhersageintervalle erzeugt — garantierte Abdeckung des wahren Werts bei einem festgelegten Konfidenzniveau — ohne Verteilungsannahmen über das zugrunde liegende Modell zu treffen. Das Framework geht der LLM-Ära um Jahre voraus und ist im Kern modellagnostisch; es lässt sich also ohne Änderung auf Sprachmodelle übertragen: Man kann um jedes LLM eine Conformal-Prediction-Schicht legen und rigorose Aussagen über die Zuverlässigkeit seiner Ausgaben erhalten. Für ai100, das vergleichende Scores über Engines hinweg berichtet, ist dies die statistische Grundlage, die nötig ist, um an diese Zahlen echte Konfidenzintervalle anzuhängen, statt der Gewohnheit des Feldes zu folgen, Punktschätzungen so zu berichten, als wären sie Tatsachen.