Tushar Khot
Qué significa realmente «capacidad de razonamiento» como algo que se puede poner en un benchmark, y qué cambia cuando también se intenta guiar al modelo para que razone mediante prompting estructurado.
ARC, que Khot ayudó a diseñar en AI2, es el benchmark de ciencia escolar que los artículos actuales sobre LLM citan como evidencia de «capacidad de razonamiento»: preguntas en las que el modelo tiene que determinar qué escenario explica una observación, un paso que va más allá de la recuperación superficial de hechos. El mismo instinto impulsa su trabajo Decomposed Prompting (2023, autor principal): si una tarea compleja puede descomponerse en un conjunto estable de subtareas, se puede formular un prompt para cada subtarea por separado y recomponer los resultados, obteniendo tanto mayor exactitud como una traza inspeccionable de lo que hizo el modelo. Juntas, las dos líneas hacen de ARC una herramienta de evaluación más fuerte: se puede identificar exactamente en qué punto de la cadena de razonamiento el modelo perdió la pregunta.