El grupo de Hashimoto mantiene una línea de investigación discretamente insistente: cuando un benchmark produce un resultado, qué parte de ese resultado es el modelo y qué parte es el montaje experimental. Su benchmark de 2023 para resumen de noticias mostró que los LLM declarados "casi humanos" en conjuntos de datos estándar debían tanto a las convenciones frágiles de puntuación de esos conjuntos como a la calidad del modelo. El mismo escepticismo impulsa su trabajo anterior sobre robustez distribucional: un modelo que funciona bien en un conjunto de prueba reservado puede haber aprendido la inclinación del conjunto de prueba más que la tarea subyacente.

Vale la pena seguirlo cuando
se quiere leer un artículo de evaluación y saber si conviene creer el número del titular.
Temas
evaluación estadística de modelos de lenguaje; validez de benchmarks y contaminación; robustez distribucional de modelos entrenados.
Obras clave
Benchmarking LLMs for News Summarization (2023); trabajo fundacional sobre robustez distribucional y group DRO (2019, en curso).