Gideon Mann
Wie Sprachmodelle aussehen, wenn sie für eine einzige hochwertige Vertikale trainiert werden — in diesem Fall Finanzwesen — und welche Evaluation diese Spezialisierung jenseits allgemeiner Benchmarks erfordert.
Mann leitete BloombergGPT (2023) mit, eines der ersten großen vertikalen Sprachmodelle — ein Modell mit 50 Milliarden Parametern, primär auf Bloombergs Finanzdokumenten-Korpus trainiert und dafür ausgelegt, allgemeine LLMs auf Finanz-NLP-Aufgaben zu übertreffen. Der Evaluationsteil des Papers ist methodisch für sich interessant: ein direkter Vergleich mit allgemeinen LLMs sowohl auf finanzspezifischen Aufgaben (wo BloombergGPT gewinnen sollte) als auch auf allgemeinen Benchmarks (wo es konkurrenzfähig bleiben musste). Für ai100 ist die Literatur zur Evaluation vertikaler LLMs wichtig, weil sie eine Frage beantwortet, vor der wir irgendwann stehen werden: Wie evaluiert man ein domänenspezialisiertes Modell fair gegen einen Generalisten bei Anfragen, die beide Kompetenzarten umfassen?