Jonathan Berant
Действительно ли языковая модель выполняет шаги рассуждения, необходимые для ответа на вопрос, — или просто выдаёт ответ, который случайно оказывается правильным.
Для сложных вопросов — «какова суммарная численность населения стран, столица которых начинается с B?» — различие между знанием ответа и рассуждением, ведущим к нему, имеет значение, но большинство оценок QA схлопывает оба случая в один балл корректности. Работы Berant BREAK и QDMR формализовали альтернативу: декомпозировать каждый сложный вопрос на атомарные шаги рассуждения, которые он подразумевает, а затем проверять, прошла ли модель через эти шаги, а не только совпал ли финальный ответ. Benchmark DROP для reading comprehension (2019, соавтор) количественно показал, сколько нынешние LLM теряют, когда вопрос требует действительно скомпоновать промежуточные факты, чтобы прийти к ответу.