Vor Dodges Arbeit verglichen die meisten Publikationen zur LLM-Effizienz Ergebnisse, die unter inkompatiblen Bedingungen entstanden waren — unterschiedliche Budgets für Hyperparameter-Suche, unterschiedliche Datensatzvarianten, undokumentierte Normalisierungsschritte, die Head-to-Head-Zahlen irreführend machten. Der Reporting-Standard „Show Your Work“, den er formulierte und bei NeurIPS und ACL als Reviewer-Anforderung vorantrieb, machte Reproduzierbarkeit aus einer Konvention zu einer durchsetzbaren Linie. Derselbe Instinkt treibt seine Green-AI-Arbeit an — nicht nur Genauigkeit berichten, sondern auch Rechenkosten, denn „Prozent korrekt“ ist ohne sie keine zwischen Laboren vergleichbare Zahl.

Lesenswert, wenn
man wissen will, was tatsächlich von einer LLM-Publikation wahr sein müsste, damit das berichtete Ergebnis von jemand anderem reproduzierbar ist.
Themen
Reporting-Standards für ML-Forschung (Show Your Work); Green-AI-Methodik und Energiekostenrechnung; wie Infrastruktur zur Evaluation offener Modelle aussieht (OLMo, Dolma, DataDecide).
Zentrale Arbeiten
„Show Your Work: Improved Reporting of Experimental Results“ (2019); „Green AI“-Positionspapier (2019, Mitautor); OLMo- und Dolma-Tooling zur Evaluation offener Modelle (2024).