Les recherches de Zou à Stanford ont suivi la liste croissante des dispositifs médicaux IA/ML approuvés par la FDA et la méthodologie d'évaluation que chacun devait satisfaire : non pas des scores de benchmark, mais des études prospectives de performance clinique avec des critères d'évaluation prédéfinis. Ses travaux incluent aussi des comparaisons systématiques entre LLM et cliniciens sur le question-réponse médical, ce qui donne au domaine un repère calibré pour comprendre ce que requiert réellement l'affirmation « ce LLM est médicalement fiable ». Pour ai100, l'IA biomédicale est l'exemple méthodologique — un domaine où la question d'évaluation ressemble structurellement à la nôtre (une recommandation à forts enjeux dans un contexte qui affecte des résultats réels), mais où les enjeux ont imposé une discipline méthodologique plus longue que celle que l'évaluation générale des LLM a encore développée.

À lire lorsque
vous voulez une méthodologie d'évaluation des LLM informée par un domaine où les enjeux ont déjà imposé des standards rigoureux — et voulez voir ce que ces standards exigent réellement.
Thèmes
évaluation de l'IA biomédicale; méthodologie d'approbation des dispositifs médicaux IA/ML dans le circuit FDA; pont entre évaluation de niveau réglementaire et benchmarking général des LLM.
Travaux clés
ensemble de travaux sur les dispositifs médicaux d'IA approuvés par la FDA et leurs critères d'évaluation (Stanford, 2020 et après); études systématiques de comparaison LLM-cliniciens; publications en cours sur la méthodologie d'évaluation de l'IA en santé.