Tatsunori Hashimoto
Si los números reportados sobre los modelos de lenguaje son hallazgos estadísticos o artefactos metodológicos.
El grupo de Hashimoto mantiene una línea de investigación discretamente insistente: cuando un benchmark produce un resultado, qué parte de ese resultado es el modelo y qué parte es el montaje experimental. Su benchmark de 2023 para resumen de noticias mostró que los LLM declarados "casi humanos" en conjuntos de datos estándar debían tanto a las convenciones frágiles de puntuación de esos conjuntos como a la calidad del modelo. El mismo escepticismo impulsa su trabajo anterior sobre robustez distribucional: un modelo que funciona bien en un conjunto de prueba reservado puede haber aprendido la inclinación del conjunto de prueba más que la tarea subyacente.