La investigación de Zou en Stanford ha seguido el creciente repertorio de dispositivos médicos de IA/ML aprobados por la FDA y la metodología de evaluación que cada uno tuvo que satisfacer: no puntuaciones de benchmark, sino estudios prospectivos de rendimiento clínico con criterios de valoración predefinidos. Su trabajo también incluye comparaciones sistemáticas entre LLM y clínicos en respuesta a preguntas médicas, lo que da al campo una referencia calibrada de lo que realmente exige afirmar «este LLM es médicamente fiable». Para ai100, la IA biomédica es el ejemplo metodológico: un dominio donde la pregunta de evaluación es estructuralmente similar a la nuestra (una recomendación de alto impacto en un contexto que afecta resultados reales), pero donde lo que está en juego ha impuesto una disciplina metodológica más larga que la evaluación general de LLM aún no ha desarrollado.

Vale la pena seguirlo cuando
se quiere metodología de evaluación de LLM informada por un dominio donde lo que está en juego ya ha impuesto estándares rigurosos, y se quiere ver qué exigen realmente esos estándares.
Temas
evaluación de IA biomédica; metodología de aprobación de dispositivos médicos de IA/ML en la vía de la FDA; el puente entre evaluación de grado regulatorio y benchmarking general de LLM.
Obras clave
trayectoria de trabajo sobre dispositivos médicos de IA aprobados por la FDA y sus criterios de evaluación (Stanford, 2020 en adelante); estudios sistemáticos de comparación entre LLM y clínicos; publicaciones en curso sobre metodología de evaluación de IA en salud.