Для сложных вопросов — «какова суммарная численность населения стран, столица которых начинается с B?» — различие между знанием ответа и рассуждением, ведущим к нему, имеет значение, но большинство оценок QA схлопывает оба случая в один балл корректности. Работы Berant BREAK и QDMR формализовали альтернативу: декомпозировать каждый сложный вопрос на атомарные шаги рассуждения, которые он подразумевает, а затем проверять, прошла ли модель через эти шаги, а не только совпал ли финальный ответ. Benchmark DROP для reading comprehension (2019, соавтор) количественно показал, сколько нынешние LLM теряют, когда вопрос требует действительно скомпоновать промежуточные факты, чтобы прийти к ответу.

Стоит читать, когда
вы хотите оценивать не только то, получила ли LLM правильный ответ, но и то, пришла ли она к нему структурно честным рассуждением.
Темы
декомпозиция вопросов на атомарные шаги рассуждения (QDMR, BREAK); композиционное понимание текста (DROP); разрыв между правильностью ответа и правильностью рассуждения.
Ключевые работы
датасет BREAK с QDMR-аннотациями (2020, ведущий автор); benchmark DROP для reading comprehension (2019, соавтор); текущая работа Tel Aviv и Google DeepMind по композиционному рассуждению.