Rishi Bommasani
Ce que les développeurs de modèles de langage nous disent, et ne nous disent pas, sur leurs propres modèles — et comment le mesurer systématiquement.
La plupart des évaluations publiques des LLM mesurent ce qu'un modèle peut faire. Le Foundation Model Transparency Index de Bommasani, mené depuis Stanford CRFM, suit un axe perpendiculaire : ce que nous savons du modèle lui-même — ce qui était dans ses données d'entraînement, quelles évaluations internes ont été effectuées, quels impacts aval ont été documentés, ce qui a été rendu public par opposition à ce qui est resté privé. L'argument sous-jacent est direct : les benchmarks de capacité disent peu lorsque les conditions qui ont produit ces capacités ne figurent pas au dossier, et traiter la transparence comme une discipline de recherche séparée (plutôt que comme un enjeu de relations publiques) est la seule manière de rendre la comparaison honnête.