La synthèse de Hu, "Harnessing the Power of Large Language Models in Practice" (2023, auteur senior), occupe un autre coin de la littérature de synthèse que les panoramas académiquement denses à la Zhao ou à la Wen : elle organise le domaine autour des questions auxquelles une vraie équipe de déploiement doit répondre — quel modèle convient à quelle classe de problème, à quoi ressemblent les exigences de données à l'échelle de production, ce que coûtent réellement le réglage fin (fine-tuning) par rapport au prompting, où apparaissent les failles de confiance. Le même réflexe traverse son travail au D2K Lab sur le ML automatisé et interprétable — une méthodologie conçue pour que quelqu'un hors du laboratoire de recherche puisse reproduire le résultat et auditer la manière dont il a été atteint. Pour ai100, c'est la littérature qui cartographie comment un comportement de mention de marque devrait être évalué par quelqu'un qui doit défendre l'évaluation devant un service achats.

À lire lorsque
vous devez évaluer des LLM depuis la position d'un praticien et voulez une littérature cadrée pour le déploiement plutôt que pour les records de benchmark.
Thèmes
synthèses pratiques sur le déploiement des LLM; ML automatisé et interprétable; considérations d'efficacité des LLM pour l'usage en production.
Travaux clés
"Harnessing the Power of Large Language Models in Practice: A Survey" (2023, auteur senior); publications du D2K Lab sur l'AutoML; travaux au long cours sur le ML interprétable et l'AutoML à Rice.