Shi a coécrit en 2023 la synthèse "Siren's Song" sur les hallucinations avec Yue Zhang, mais il a abordé le problème depuis le côté déploiement — le centre NLP d'une grande plateforme technologique chinoise dont les produits atteignent environ un milliard d'utilisateurs. La même taxonomie des types d'hallucination (factualité vs. fidélité (à la source), intrinsèque vs. extrinsèque) se lit différemment lorsque la question est opérationnelle : quelles catégories apparaissent vraiment dans le trafic de production, lesquelles peuvent être filtrées en aval, et lesquelles exigent de modifier la campagne d'entraînement sous-jacente. Il vaut la peine de le lire aux côtés du versant académique de la même synthèse, car la perspective du déploiement fait apparaître des modes d'échec que le travail de benchmark pur ne voit pas.

À lire lorsque
vous voulez savoir quelles catégories d'hallucination cassent les systèmes en production, et lesquelles comptent surtout dans les benchmarks académiques.
Thèmes
catégories d'hallucination dans les produits LLM déployés; NLP industriel à grande échelle; écart entre comportement en benchmark et comportement en production.
Travaux clés
"Siren's Song in the AI Ocean: A Survey on Hallucination in LLMs" (2023, co-auteur); publications en cours du NLP Center de Tencent AI Lab.