Shafiq Joty
La méthodologie d'évaluation des modèles de langage lorsque le contexte de déploiement est le logiciel d'entreprise plutôt qu'une démonstration de recherche.
Les travaux publiés plus tôt par Joty portent sur l'analyse de la structure discursive — le type de NLP où l'on demande si un paragraphe tient comme argument, et pas seulement si chaque phrase s'analyse correctement. Cette habitude se retrouve dans ses publications plus récentes sur l'évaluation des LLM : une application LLM d'entreprise doit produire des sorties qui conservent leur forme argumentative à travers un usage multi-tours, et les benchmarks standard en une seule interaction ne capturent pas cela. Ce corpus de travaux agit comme un rappel constant : « le modèle réussit un benchmark » et « le modèle tient sous trafic d’entreprise » ne sont pas la même affirmation.