Ashish Sabharwal
Qué puede aportar la investigación clásica en razonamiento formal a la evaluación de si los LLM modernos razonan realmente, y cómo distinguir eso de un lenguaje con forma de razonamiento que casualmente llega a la respuesta correcta.
Sabharwal llegó a la investigación sobre LLM desde una formación en razonamiento formal y satisfacibilidad: áreas donde «¿razona correctamente el sistema?» tiene un significado preciso, medido contra especificaciones lógicas y verificable mediante pruebas operativas. Ese trasfondo se lee en su trabajo más reciente sobre evaluación del razonamiento de LLM: una tendencia a mirar si la estructura del razonamiento coincide con la estructura que exige el problema, además de si la respuesta final resulta ser correcta. ARC y benchmarks similares son un producto de esa postura: diseñados para que la fluidez superficial no sustituya a la inferencia real.