Jonathan Berant
Si un modelo de lenguaje está haciendo realmente los pasos de razonamiento necesarios para responder a una pregunta — o solo produciendo una respuesta que resulta ser correcta.
Para preguntas complejas —«¿cuál es la población total de los países cuya capital empieza por "B"?»—, la diferencia entre conocer la respuesta y razonar hasta ella importa, pero la mayoría de las evaluaciones de QA colapsa ambas cosas en una única puntuación de corrección. El trabajo de Berant en BREAK y QDMR formalizó la alternativa: descomponer cada pregunta compleja en los pasos atómicos de razonamiento que implica, y luego comprobar si el modelo pasó por esos pasos, no solo si la respuesta final coincidió. El benchmark de comprensión lectora DROP (2019, coautor) puso números a cuánto pierden los LLM actuales cuando la pregunta exige componer realmente hechos intermedios para llegar a la respuesta.