Gideon Mann
Как выглядят языковые модели, обученные под одну высокоценную вертикаль — в данном случае финансы, — и какая оценка этой специализации нужна помимо универсальных benchmark.
Mann был одним из руководителей BloombergGPT (2023), одной из первых крупных вертикальных больших языковых моделей: модели на 50 млрд параметров, обученной преимущественно на корпусе финансовых документов Bloomberg и спроектированной так, чтобы превосходить LLM общего назначения на задачах финансового NLP. Раздел оценки в статье методологически интересен сам по себе: прямое сравнение с LLM общего назначения как на финансово-специфических задачах (где BloombergGPT должна была выигрывать), так и на общих benchmark-ах (где она должна была оставаться конкурентоспособной). Для ai100 литература по оценке вертикальных LLM важна потому, что отвечает на вопрос, с которым мы в итоге столкнёмся: как справедливо оценивать доменную модель-специалиста против универсальной модели на запросах, где пересекаются оба типа компетентности.