Les travaux publiés plus tôt par Joty portent sur l'analyse de la structure discursive — le type de NLP où l'on demande si un paragraphe tient comme argument, et pas seulement si chaque phrase s'analyse correctement. Cette habitude se retrouve dans ses publications plus récentes sur l'évaluation des LLM : une application LLM d'entreprise doit produire des sorties qui conservent leur forme argumentative à travers un usage multi-tours, et les benchmarks standard en une seule interaction ne capturent pas cela. Ce corpus de travaux agit comme un rappel constant : « le modèle réussit un benchmark » et « le modèle tient sous trafic d’entreprise » ne sont pas la même affirmation.

À lire lorsque
vous avez besoin d'une perspective d'évaluation informée par ce que le déploiement de fonctionnalités LLM auprès de clients d'entreprise exige réellement de la méthodologie sous-jacente.
Thèmes
structure discursive comme prisme sur les sorties LLM longues; évaluation multi-tours au-delà des benchmarks en une seule interaction; écart entre benchmarks de recherche et déploiement en entreprise.
Travaux clés
travaux fondateurs antérieurs sur l'analyse du discours (RST et au-delà); publications en cours sur l'évaluation multi-tours des LLM et la fiabilité.