Sabharwal llegó a la investigación sobre LLM desde una formación en razonamiento formal y satisfacibilidad: áreas donde «¿razona correctamente el sistema?» tiene un significado preciso, medido contra especificaciones lógicas y verificable mediante pruebas operativas. Ese trasfondo se lee en su trabajo más reciente sobre evaluación del razonamiento de LLM: una tendencia a mirar si la estructura del razonamiento coincide con la estructura que exige el problema, además de si la respuesta final resulta ser correcta. ARC y benchmarks similares son un producto de esa postura: diseñados para que la fluidez superficial no sustituya a la inferencia real.

Vale la pena seguirlo cuando
se quiere evaluación del razonamiento de LLM anclada en la tradición más antigua del razonamiento formal, donde «corrección» tenía significado operativo antes de que llegara el deep learning.
Temas
razonamiento formal y resolución SAT aplicados a la evaluación de LLM; inspección de trazas de razonamiento en benchmarks de QA; puente entre la inferencia clásica de IA y el comportamiento actual de LLM.
Obras clave
AI2 Reasoning Challenge / ARC (2018, coautor); trabajo de la era pre-LLM sobre inferencia tratable y SAT; publicaciones recientes de la era LLM sobre evaluación de razonamiento desde AI2.