Le groupe de Hashimoto mène une ligne de recherche discrète mais insistante : lorsqu'un benchmark produit un résultat, quelle part de ce résultat vient du modèle et quelle part vient du dispositif expérimental ? Son benchmark de 2023 pour la synthèse d'actualités a montré que les LLM déclarés « presque humains » sur des jeux de données standard devaient autant ce statut aux conventions fragiles de notation (scoring) de ces jeux de données qu'à la qualité du modèle. Le même scepticisme anime ses travaux plus anciens sur la robustesse distributionnelle — un modèle qui réussit sur un jeu de test réservé a peut-être appris le biais propre à ce jeu de test plutôt que la tâche sous-jacente.

À lire lorsque
vous voulez lire un article d'évaluation et savoir si vous devez croire le chiffre mis en avant.
Thèmes
évaluation statistique des modèles de langage; validité des benchmarks et contamination; robustesse distributionnelle des modèles entraînés.
Travaux clés
Benchmarking LLMs for News Summarization (2023); travaux fondateurs sur la robustesse distributionnelle et group DRO (2019, en cours).