Gideon Mann
À quoi ressemblent les modèles de langage lorsqu'ils sont entraînés pour un domaine vertical unique à forte valeur — la finance, en l'occurrence — et ce que l'évaluation de cette spécialisation exige au-delà des benchmarks généralistes.
Mann a codirigé BloombergGPT (2023), l'un des premiers grands modèles de langage verticaux majeurs — un modèle de 50 milliards de paramètres entraîné principalement sur le corpus de documents financiers de Bloomberg, conçu pour surpasser les LLM généralistes sur les tâches de NLP financier. La section d'évaluation de l'article est méthodologiquement intéressante en soi : comparaison côte à côte avec des LLM généralistes à la fois sur des tâches propres à la finance (où BloombergGPT était censé gagner) et sur des benchmarks généraux (où il devait rester compétitif). Pour ai100, la littérature sur l'évaluation des LLM verticaux importe parce qu'elle répond à une question que nous finirons par rencontrer : comment évaluer équitablement un modèle spécialiste d'un domaine face à un généraliste sur des requêtes qui couvrent les deux types de compétence.