L'article de Microsoft Research "Sparks of Artificial General Intelligence", coécrit par Horvitz en 2023, a été l'évaluation qualitative la plus citée de GPT-4 dans le domaine — plus d'une centaine de pages d'exemples montrant le modèle faire des choses que ses prédécesseurs ne pouvaient pas faire, cadrées comme des indices préliminaires de capacités approchant l'intelligence générale. L'article a immédiatement été critiqué pour son absence de protocole systématique, mais la critique a surtout manqué ce qui rendait le document influent : il a donné à l'industrie un vocabulaire pour nommer ce qu'elle avait sous les yeux avant que quiconque ait construit des instruments rigoureux pour le mesurer. La carrière plus longue de Horvitz — IA probabiliste, aide à la décision médicale, présidence de l'AAAI, construction de l'infrastructure d'IA responsable de Microsoft — lui donne une autorité que le lecteur occasionnel de "Sparks" manque souvent.

À lire lorsque
vous voulez lire la perspective industrielle senior sur ce dont les LLM actuels sont capables, même quand — surtout quand — cette perspective est méthodologiquement informelle d'une manière dont la propre évaluation d'ai100 est l'antidote.
Thèmes
évaluation qualitative des capacités des LLM (Sparks); IA probabiliste et méthodes décisionnelles; infrastructure d'IA responsable au sein des grands laboratoires de modèles (Aether).
Travaux clés
"Sparks of Artificial General Intelligence: Early experiments with GPT-4" (2023, auteur senior); plusieurs décennies de publications en IA probabiliste et en aide à la décision médicale; Aether Working Group on responsible AI.