Emmanuel Candès
Comment placer des intervalles d'incertitude statistique valides autour des prédictions de n'importe quel modèle — y compris les modèles de langage — sans supposer que l'on sait quel type de distribution d'erreur attendre.
Candès est l'une des figures fondatrices de la prédiction conforme, un cadre statistique qui produit des intervalles de prédiction calibrés — couverture garantie de la vraie valeur à un niveau de confiance spécifié — sans formuler d'hypothèses de distribution sur le modèle sous-jacent. Le cadre précède de plusieurs années l'ère des LLM et il est essentiellement agnostique au modèle, ce qui signifie qu'il se transfère aux modèles de langage sans modification : on peut envelopper n'importe quel LLM dans de la prédiction conforme et obtenir des énoncés rigoureux sur la fiabilité de ses sorties. Pour ai100, qui rapporte des scores comparatifs entre moteurs, c'est le fondement statistique nécessaire pour associer de véritables intervalles de confiance à ces nombres, plutôt que de s'appuyer sur l'habitude du domaine consistant à présenter des estimations ponctuelles comme si elles étaient des faits.