Shafiq Joty
Metodología de evaluación para modelos de lenguaje cuando el contexto de despliegue es software empresarial y no una demo de investigación.
El trabajo publicado anterior de Joty está en el análisis de estructura discursiva: el tipo de NLP donde se pregunta si un párrafo se sostiene como argumento, no solo si cada oración se analiza correctamente. Ese hábito se traslada a sus publicaciones más recientes sobre evaluación de LLM: una aplicación empresarial de LLM tiene que producir salidas que mantengan su forma argumentativa a lo largo del uso de varios turnos, y los benchmarks estándar de una sola interacción no capturan eso. La trayectoria se lee como un recordatorio constante de que «el modelo supera un benchmark» y «el modelo aguanta bajo tráfico empresarial» no son la misma afirmación.