Para preguntas complejas —«¿cuál es la población total de los países cuya capital empieza por "B"?»—, la diferencia entre conocer la respuesta y razonar hasta ella importa, pero la mayoría de las evaluaciones de QA colapsa ambas cosas en una única puntuación de corrección. El trabajo de Berant en BREAK y QDMR formalizó la alternativa: descomponer cada pregunta compleja en los pasos atómicos de razonamiento que implica, y luego comprobar si el modelo pasó por esos pasos, no solo si la respuesta final coincidió. El benchmark de comprensión lectora DROP (2019, coautor) puso números a cuánto pierden los LLM actuales cuando la pregunta exige componer realmente hechos intermedios para llegar a la respuesta.

Vale la pena seguirlo cuando
se quiere evaluar no solo si un LLM acertó la respuesta, sino si razonó hasta ella de una manera estructuralmente honesta.
Temas
descomposición de preguntas en pasos atómicos de razonamiento (QDMR, BREAK); comprensión lectora composicional (DROP); brecha entre corrección de la respuesta y corrección del razonamiento.
Obras clave
dataset BREAK con anotaciones QDMR (2020, autor principal); benchmark de comprensión lectora DROP (2019, coautor); trabajo en curso en Tel Aviv y Google DeepMind sobre razonamiento composicional.