Las herramientas Anserini y Pyserini de Lin se convirtieron en la capa de reproducibilidad por defecto para la investigación en recuperación en cuanto aparecieron: cuando un artículo de NLP informa hoy de una cifra de línea base BM25, esa cifra suele venir de su código. La misma postura se traslada a HyDE (Hypothetical Document Embeddings, 2023, autor sénior): la idea era usar un modelo de lenguaje para generar un documento de respuesta sintético, codificarlo en un embedding y recuperar contra ese embedding; un método lo bastante limpio como para que otros grupos pudieran replicarlo sin negociar detalles de implementación. Leer a Lin es la forma de entender qué resultados de recuperación en artículos actuales sobre LLM significan algo de verdad y cuáles dependen de líneas base no documentadas.

Vale la pena seguirlo cuando
se quiere saber si un resultado relacionado con recuperación en un artículo es reproducible — y cómo preparar el propio para que lo sea.
Temas
recuperación densa y recuperación zero-shot mediante embeddings generados por LLM; infraestructura de reproducibilidad para investigación en IR; el puente entre las comunidades de IR y NLP neuronal.
Obras clave
toolkit de IR Anserini (2017, líder); Pyserini (2021, líder); HyDE: Precise Zero-Shot Dense Retrieval (2023, autor sénior).