El trabajo publicado anterior de Joty está en el análisis de estructura discursiva: el tipo de NLP donde se pregunta si un párrafo se sostiene como argumento, no solo si cada oración se analiza correctamente. Ese hábito se traslada a sus publicaciones más recientes sobre evaluación de LLM: una aplicación empresarial de LLM tiene que producir salidas que mantengan su forma argumentativa a lo largo del uso de varios turnos, y los benchmarks estándar de una sola interacción no capturan eso. La trayectoria se lee como un recordatorio constante de que «el modelo supera un benchmark» y «el modelo aguanta bajo tráfico empresarial» no son la misma afirmación.

Vale la pena seguirlo cuando
se necesita una perspectiva de evaluación informada por lo que desplegar funciones basadas en LLM para clientes empresariales realmente exige de la metodología subyacente.
Temas
estructura discursiva como lente sobre salidas largas de LLM; evaluación multi-turno más allá de benchmarks de una sola interacción; brecha entre benchmarks de investigación y despliegue empresarial.
Obras clave
trabajos fundacionales anteriores sobre análisis del discurso (RST y más allá); publicaciones en curso sobre evaluación multi-turno y fiabilidad de LLM.