Tatsunori Hashimoto
Déterminer si les chiffres publiés à propos des modèles de langage sont des résultats statistiques ou des artefacts méthodologiques.
Le groupe de Hashimoto mène une ligne de recherche discrète mais insistante : lorsqu'un benchmark produit un résultat, quelle part de ce résultat vient du modèle et quelle part vient du dispositif expérimental ? Son benchmark de 2023 pour la synthèse d'actualités a montré que les LLM déclarés « presque humains » sur des jeux de données standard devaient autant ce statut aux conventions fragiles de notation (scoring) de ces jeux de données qu'à la qualité du modèle. Le même scepticisme anime ses travaux plus anciens sur la robustesse distributionnelle — un modèle qui réussit sur un jeu de test réservé a peut-être appris le biais propre à ce jeu de test plutôt que la tâche sous-jacente.