James Zou
Wie Evaluation aussieht, wenn die bewertete KI vor dem Deployment regulatorische Hürden nehmen muss — und was allgemeine LLM-Evaluation von einem Feld lernen sollte, das dies seit Jahren tut.
Zous Forschung bei Stanford hat die wachsende Liste FDA-zugelassener AI/ML-Medizinprodukte und die Bewertungsmethodik verfolgt, der jedes einzelne genügen musste: nicht Benchmark-Scores, sondern prospektive klinische Performance-Studien mit vorab definierten Endpunkten. Seine Arbeit umfasst auch systematische Vergleiche von LLMs und Klinikern bei medizinischem Question Answering, was dem Feld eine kalibrierte Referenz dafür gibt, was „dieses LLM ist medizinisch zuverlässig“ tatsächlich verlangt. Für ai100 ist biomedizinische KI das methodische Vorbild — eine Domäne, in der die Evaluationsfrage strukturell unserer ähnelt (eine folgenreiche Empfehlung in einem Kontext, der reale Ergebnisse beeinflusst), in der die Einsätze aber eine längere methodische Disziplin erzwungen haben, als allgemeine LLM-Evaluation bisher entwickelt hat.