Mann codirigió BloombergGPT (2023), uno de los primeros grandes LLM verticales: un modelo de 50.000 millones de parámetros entrenado principalmente sobre el corpus de documentos financieros de Bloomberg, diseñado para superar a LLM de propósito general en tareas de NLP financiero. La sección de evaluación del artículo es metodológicamente interesante por derecho propio: comparación lado a lado con LLM de propósito general tanto en tareas específicas de finanzas (donde se suponía que BloombergGPT debía ganar) como en benchmarks generales (donde tenía que seguir siendo competitivo). Para ai100, la literatura sobre evaluación de LLM verticales importa porque responde una pregunta que acabaremos afrontando: cómo evaluar de forma justa un modelo especialista de dominio frente a un generalista en consultas que abarcan ambos tipos de competencia.

Vale la pena seguirlo cuando
se necesita metodología para evaluar LLM especialistas de dominio frente a LLM de propósito general, o se quiere la literatura sobre qué aporta realmente el entrenamiento de LLM verticales.
Temas
desarrollo de LLM de dominio vertical (BloombergGPT); evaluación de NLP financiero; desafío metodológico de comparar modelos especialistas y generalistas en tareas superpuestas.
Obras clave
BloombergGPT: A Large Language Model for Finance (2023, coautor); larga trayectoria de investigación en ML en Google y Bloomberg; publicaciones en curso sobre NLP financiero a escala.