Jimmy Lin
Hacer que la recuperación de información sea lo bastante reproducible como para que un investigador de LLM y un investigador de IR puedan ejecutar el mismo experimento y obtener la misma respuesta.
Las herramientas Anserini y Pyserini de Lin se convirtieron en la capa de reproducibilidad por defecto para la investigación en recuperación en cuanto aparecieron: cuando un artículo de NLP informa hoy de una cifra de línea base BM25, esa cifra suele venir de su código. La misma postura se traslada a HyDE (Hypothetical Document Embeddings, 2023, autor sénior): la idea era usar un modelo de lenguaje para generar un documento de respuesta sintético, codificarlo en un embedding y recuperar contra ese embedding; un método lo bastante limpio como para que otros grupos pudieran replicarlo sin negociar detalles de implementación. Leer a Lin es la forma de entender qué resultados de recuperación en artículos actuales sobre LLM significan algo de verdad y cuáles dependen de líneas base no documentadas.