Shi war Mitautor des 2023 erschienenen Halluzinationssurveys „Siren's Song in the AI Ocean“ mit Yue Zhang, kam aber von der Deployment-Seite an das Problem heran — aus dem NLP-Zentrum einer großen chinesischen Technologieplattform, deren Produkte ungefähr eine Milliarde Nutzer erreichen. Dieselbe Taxonomie der Halluzinationstypen (Faktentreue vs. Quellentreue, intrinsisch vs. extrinsisch) liest sich anders, wenn die Frage operativ gestellt wird: Welche Kategorien tauchen tatsächlich im Produktions-Traffic auf, welche lassen sich durch einen nachgelagerten Filter abfangen, und welche erfordern eine Änderung des zugrunde liegenden Trainingslaufs? Es lohnt sich, ihn neben der akademischen Seite desselben Surveys zu lesen, weil die Deployment-Perspektive Fehlermodi sichtbar macht, die reine benchmark-Arbeit übersieht.

Lesenswert, wenn
man wissen will, welche Halluzinationskategorien in der Produktion Dinge kaputtmachen und welche nur in akademischen benchmarks zählen.
Themen
Halluzinationskategorien in deployten LLM-Produkten; industrielles NLP im großen Maßstab; die Lücke zwischen benchmark-Verhalten und Produktionsverhalten.
Zentrale Arbeiten
„Siren's Song in the AI Ocean: A Survey on Hallucination in LLMs“ (2023, Mitautor); laufende Publikationen des Tencent AI Lab NLP Center.