Mann leitete BloombergGPT (2023) mit, eines der ersten großen vertikalen Sprachmodelle — ein Modell mit 50 Milliarden Parametern, primär auf Bloombergs Finanzdokumenten-Korpus trainiert und dafür ausgelegt, allgemeine LLMs auf Finanz-NLP-Aufgaben zu übertreffen. Der Evaluationsteil des Papers ist methodisch für sich interessant: ein direkter Vergleich mit allgemeinen LLMs sowohl auf finanzspezifischen Aufgaben (wo BloombergGPT gewinnen sollte) als auch auf allgemeinen Benchmarks (wo es konkurrenzfähig bleiben musste). Für ai100 ist die Literatur zur Evaluation vertikaler LLMs wichtig, weil sie eine Frage beantwortet, vor der wir irgendwann stehen werden: Wie evaluiert man ein domänenspezialisiertes Modell fair gegen einen Generalisten bei Anfragen, die beide Kompetenzarten umfassen?

Lesenswert, wenn
man Methodik zur Evaluation domänenspezialisierter LLMs gegenüber allgemeinen LLMs braucht oder die Literatur dazu lesen will, was vertikales LLM-Training tatsächlich bringt.
Themen
Entwicklung vertikaler Domänen-LLMs (BloombergGPT); Finanz-NLP-Evaluation; die methodische Herausforderung, Spezialisten- und Generalistenmodelle auf überlappenden Aufgaben zu vergleichen.
Zentrale Arbeiten
BloombergGPT: A Large Language Model for Finance (2023, Mitautor); langer Werkkomplex zu ML-Forschung bei Google und Bloomberg; laufende Publikationen zu Finanz-NLP im großen Maßstab.