"When Not to Trust Language Models" (2023, avec des collaborateurs de UW et AI2) est la formulation la plus nette d'une question que le domaine contournait depuis longtemps : le savoir interne d'un modèle de langage est inégal selon les sujets et leur fréquence, et une évaluation honnête doit distinguer les faits que le modèle connaît réellement de ceux qu'il énonce simplement avec assurance. Les travaux plus larges de Hajishirzi — à la tête chez AI2 de la ligne de modèles ouverts qui a produit OLMo et la famille de post-entraînement Tulu — étendent la même logique en amont : si vous voulez étudier pourquoi les modèles hallucinent, vous devez étudier des modèles que vous pouvez ouvrir, et non seulement des modèles servis derrière une API fermée.

À lire lorsque
vous voulez une méthodologie d'évaluation de la factualité qui fonctionne sur des modèles à poids ouverts que vous pouvez démonter, plutôt que seulement sur ce que renvoie aujourd'hui la dernière API fermée.
Thèmes
connaissance paramétrique vs. connaissance récupérée dans les LLM; notation (scoring) de factualité par faits atomiques; pile d'évaluation des modèles ouverts (OLMo, Tulu).
Travaux clés
"When Not to Trust Language Models" (2023, co-auteur); modèle de langage ouvert OLMo (2024, co-auteur); cadre de post-entraînement Tulu (2023, co-auteur).