Shi fue coautor del artículo de síntesis sobre alucinaciones de 2023 "Siren's Song" con Yue Zhang, pero abordó el problema desde el lado del despliegue: el centro de NLP de una gran plataforma tecnológica china cuyos productos llegan aproximadamente a mil millones de usuarios. La misma taxonomía de tipos de alucinación (factualidad frente a fidelidad (a la fuente), intrínseca frente a extrínseca) se lee de otra manera cuando la pregunta es operativa: qué categorías aparecen realmente en el tráfico de producción, cuáles pueden filtrarse con un filtro posterior y cuáles requieren cambiar la ejecución de entrenamiento subyacente. Conviene leerlo junto con el lado académico de la misma revisión, porque la perspectiva de despliegue hace visibles modos de fallo que el trabajo puramente de benchmark pasa por alto.

Vale la pena seguirlo cuando
se quiere saber qué categorías de alucinación rompen cosas en producción y cuáles solo importan en benchmarks académicos.
Temas
categorías de alucinación en productos LLM desplegados; NLP industrial a escala; la brecha entre el comportamiento en benchmarks y el comportamiento en producción.
Obras clave
"Siren's Song in the AI Ocean: A Survey on Hallucination in LLMs" (2023, coautor); publicaciones en curso del NLP Center de Tencent AI Lab.