"When Not to Trust Language Models" (2023, с коллегами из UW и AI2) — самая чистая формулировка вопроса, вокруг которого область долго ходила кругами: внутреннее знание языковой модели неоднородно по темам и частотности, и честная оценка должна отличать факты, которые модель действительно знает, от фактов, о которых она лишь звучит уверенно. Более широкая работа Hajishirzi — руководство открытой модельной линией в AI2, из которой вышли OLMo и семейство post-training Tulu, — поднимает ту же логику выше по цепочке: если вы хотите изучать, почему модели галлюцинируют, нужно изучать модели, которые можно открыть, а не те, что обслуживаются за закрытым API.

Стоит читать, когда
вам нужна методология оценки фактологичности, работающая на моделях с открытыми весами, которые можно разобрать, а не только на том, что сегодня возвращает очередной закрытый API.
Темы
параметрическое и извлечённое знание в LLM; оценивание фактологичности по атомарным фактам; стек оценки открытых моделей (OLMo, Tulu).
Ключевые работы
"When Not to Trust Language Models" (2023, соавтор); OLMo open language model (2024, соавтор); Tulu post-training framework (2023, соавтор).