Zous Forschung bei Stanford hat die wachsende Liste FDA-zugelassener AI/ML-Medizinprodukte und die Bewertungsmethodik verfolgt, der jedes einzelne genügen musste: nicht Benchmark-Scores, sondern prospektive klinische Performance-Studien mit vorab definierten Endpunkten. Seine Arbeit umfasst auch systematische Vergleiche von LLMs und Klinikern bei medizinischem Question Answering, was dem Feld eine kalibrierte Referenz dafür gibt, was „dieses LLM ist medizinisch zuverlässig“ tatsächlich verlangt. Für ai100 ist biomedizinische KI das methodische Vorbild — eine Domäne, in der die Evaluationsfrage strukturell unserer ähnelt (eine folgenreiche Empfehlung in einem Kontext, der reale Ergebnisse beeinflusst), in der die Einsätze aber eine längere methodische Disziplin erzwungen haben, als allgemeine LLM-Evaluation bisher entwickelt hat.

Lesenswert, wenn
man LLM-Bewertungsmethodik will, die von einer Domäne informiert ist, in der hohe Risiken bereits rigorose Standards erzwungen haben — und sehen will, was diese Standards tatsächlich verlangen.
Themen
biomedizinische KI-Evaluation; FDA-Track-Zulassungsmethodik für AI/ML-Medizinprodukte; die Brücke zwischen regulatorischer Evaluation und allgemeinem LLM-Benchmarking.
Zentrale Arbeiten
Werkkomplex zu FDA-zugelassenen AI/ML-Medizinprodukten und ihren Bewertungskriterien (Stanford, seit 2020); systematische LLM-vs-Kliniker-Vergleichsstudien; laufende Publikationen zur Bewertungsmethodik von KI im Gesundheitswesen.