Gideon Mann
Cómo son los modelos de lenguaje cuando se entrenan para una vertical única de alto valor —finanzas, en este caso— y qué evaluación exige esa especialización más allá de los benchmarks generalistas.
Mann codirigió BloombergGPT (2023), uno de los primeros grandes LLM verticales: un modelo de 50.000 millones de parámetros entrenado principalmente sobre el corpus de documentos financieros de Bloomberg, diseñado para superar a LLM de propósito general en tareas de NLP financiero. La sección de evaluación del artículo es metodológicamente interesante por derecho propio: comparación lado a lado con LLM de propósito general tanto en tareas específicas de finanzas (donde se suponía que BloombergGPT debía ganar) como en benchmarks generales (donde tenía que seguir siendo competitivo). Para ai100, la literatura sobre evaluación de LLM verticales importa porque responde una pregunta que acabaremos afrontando: cómo evaluar de forma justa un modelo especialista de dominio frente a un generalista en consultas que abarcan ambos tipos de competencia.