Le KEG Lab de Li à Tsinghua a été le foyer méthodologique de l'une des lignées les plus longues sur les modèles de langage augmentés par graphes de connaissances — OpenKE pour les embeddings de graphes de connaissances, KEPLER pour combiner graphes de connaissances et pré-entraînement du langage, et un fil de recherche qui a mené, via Zhipu, à la lignée de LLM ouverts ChatGLM. Le fil conducteur est l'engagement envers des modèles de langage qui possèdent un point d'ancrage externe en connaissances structurées en plus de leur mémoire paramétrique, ce qui rend les systèmes résultants plus faciles à auditer — on peut interroger le modèle et le graphe de connaissances séparément, puis comparer. Pour ai100, qui audite le comportement de mention des marques, la tradition d'évaluation augmentée par graphes de connaissances est le précédent le plus proche pour séparer « ce que le modèle dit » de « ce que ses sources étayent ».

À lire lorsque
vous voulez une méthodologie d'évaluation des LLM qui prenne au sérieux les points d'ancrage externes en connaissances structurées — à la fois dans la conception du modèle et dans le protocole d'audit.
Thèmes
modèles de langage augmentés par graphes de connaissances (KEPLER, OpenKE); lignée allant de la recherche sur les graphes de connaissances aux LLM chinois ouverts (ChatGLM); auditabilité par points d'ancrage externes en connaissances.
Travaux clés
bibliothèque d'embeddings de graphes de connaissances OpenKE (depuis 2018, contributrice clé); KEPLER: A Unified Model for Knowledge Embedding and Pre-trained Language Representation (2021, co-auteur); lignée de LLM ouverts ChatGLM via Zhipu (depuis 2023, cofondatrice).