Исследования Zou в Stanford отслеживали растущий реестр медицинских устройств AI/ML, одобренных FDA, и методологию оценки, которую каждое из них должно было пройти: не benchmark-баллы, а проспективные исследования клинической эффективности с заранее заданными конечными точками. Его работа также включает систематические сравнения LLM и клиницистов на задачах ответа на медицинские вопросы, что даёт области калиброванный ориентир для того, что на самом деле требуется, чтобы утверждение «эта LLM медицински надёжна» имело смысл. Для ai100 биомедицинский AI — методологический образец: домен, где вопрос оценки структурно похож на наш (рекомендация с высокими ставками в контексте, влияющем на реальные исходы), но где сами ставки вынудили более зрелую методологическую дисциплину, чем общая оценка LLM пока успела выработать.

Стоит читать, когда
вам нужна методология оценки LLM, информированная доменом, где ставки уже заставили выстроить строгие стандарты, — и вы хотите увидеть, чего эти стандарты на самом деле требуют.
Темы
оценка биомедицинского AI; методология одобрения медицинских устройств AI/ML по линии FDA; мост между оценкой регуляторного уровня и общей benchmark-практикой LLM.
Ключевые работы
корпус работ об одобренных FDA медицинских AI-устройствах и критериях их оценки (Stanford, с 2020 года); систематические сравнительные исследования LLM и клиницистов; текущие публикации по методологии оценки AI в здравоохранении.