Antes del trabajo de Dodge, la mayoría de las publicaciones sobre eficiencia de LLM comparaban resultados obtenidos en condiciones incompatibles: distintos presupuestos de búsqueda de hiperparámetros, distintas variantes de conjuntos de datos, pasos de normalización no documentados que hacían engañosas las cifras de comparación directa. El estándar de reporte "Show Your Work" que formuló e impulsó en NeurIPS y ACL como requisito de revisión convirtió la reproducibilidad de una convención en una exigencia aplicable. El mismo instinto impulsa su trabajo sobre Green AI: reportar no solo exactitud, sino coste computacional, porque el «porcentaje correcto» no es un número comparable entre laboratorios sin ese dato.

Vale la pena seguirlo cuando
se quiere saber qué tendría que ser cierto realmente en una publicación sobre LLM para que el resultado que reporta sea reproducible por otra persona.
Temas
estándares de reporte para investigación en ML (Show Your Work); metodología Green AI y contabilidad de coste energético; cómo se ve la infraestructura de evaluación de modelos abiertos (OLMo, Dolma, DataDecide).
Obras clave
"Show Your Work: Improved Reporting of Experimental Results" (2019); artículo de posición "Green AI" (2019, coautor); herramientas de evaluación de modelos abiertos OLMo y Dolma (2024).