Le node2vec de Leskovec (2016) a été l'une des premières méthodes à rendre les données structurées en graphe utilisables comme entrée de pipelines ML standard — représenter les nœuds par des vecteurs qui préservent l'information de voisinage, puis utiliser ces embeddings comme variables partout où un vecteur peut entrer. Les jeux de données et méthodes du Stanford Network Analysis Project (SNAP) qui ont suivi sont devenus le substrat par défaut de la recherche en graph-ML. Pour ai100, où la question « comment un modèle sait-il quelle marque mentionner » relève du raisonnement structuré en graphe — quelles entités sont connectées à quels contextes dans les données d'entraînement — la perspective graphe offre un angle utilement orthogonal sur ce que l'évaluation actuelle des LLM tend à ne mesurer qu'en surface.

À lire lorsque
vous voulez penser les connaissances et les comportements de raisonnement des LLM en termes de structure de graphe sous-jacente au texte, plutôt que comme une propriété du texte lui-même.
Thèmes
apprentissage automatique sur graphes et embeddings de nœuds (node2vec); le Stanford Network Analysis Project (SNAP); raisonnement structuré en graphe comme prisme sur le comportement des LLM.
Travaux clés
node2vec: Scalable Feature Learning for Networks (2016, co-auteur); jeux de données et outils du Stanford Network Analysis Project (2007 et après); contributions aux manuels et cursus de graph-ML.