James Zou
Как выглядит оценка, когда оцениваемый AI должен пройти регуляторные планки перед развёртыванием, — и чему общая оценка LLM должна научиться у области, которая занимается этим годами.
Исследования Zou в Stanford отслеживали растущий реестр медицинских устройств AI/ML, одобренных FDA, и методологию оценки, которую каждое из них должно было пройти: не benchmark-баллы, а проспективные исследования клинической эффективности с заранее заданными конечными точками. Его работа также включает систематические сравнения LLM и клиницистов на задачах ответа на медицинские вопросы, что даёт области калиброванный ориентир для того, что на самом деле требуется, чтобы утверждение «эта LLM медицински надёжна» имело смысл. Для ai100 биомедицинский AI — методологический образец: домен, где вопрос оценки структурно похож на наш (рекомендация с высокими ставками в контексте, влияющем на реальные исходы), но где сами ставки вынудили более зрелую методологическую дисциплину, чем общая оценка LLM пока успела выработать.