До работ Dodge большинство публикаций об эффективности LLM сравнивали результаты, полученные в несовместимых условиях: разные бюджеты поиска гиперпараметров, разные варианты датасетов, недокументированные шаги нормализации, из-за которых числа в прямом сравнении вводили в заблуждение. Стандарт отчётности "Show Your Work", который он сформулировал и продвигал в NeurIPS и ACL как требование рецензирования, превратил воспроизводимость из конвенции в проверяемую и обязательную норму. Тот же инстинкт ведёт его работу Green AI: сообщать не только точность, но и вычислительную стоимость, потому что «процент правильных ответов» не является сопоставимым числом между лабораториями без этой информации.

Стоит читать, когда
вы хотите понять, что действительно должно быть верно в публикации о LLM, чтобы заявленный в ней результат мог воспроизвести кто-то ещё.
Темы
стандарты отчётности для ML-исследований (Show Your Work); методология Green AI и учёт энергозатрат; как выглядит инфраструктура оценки открытых моделей (OLMo, Dolma, DataDecide).
Ключевые работы
"Show Your Work: Improved Reporting of Experimental Results" (2019); позиционная статья "Green AI" (2019, соавтор); инструментарий оценки открытых моделей OLMo и Dolma (2024).