Stoicas Name steht auf den grundlegenden Papers zu Spark (verteilte Datenverarbeitung), Ray (verteiltes Python für ML-Workloads) und dem breiteren Stack, den vLLM nutzt, um Sprachmodelle effizient bereitzustellen — Artefakte, die zum De-facto-Substrat für ML in der Industrie geworden sind. Das Muster ist konsistent: ein System um die tatsächlichen Rechenengpässe herum entwerfen, vor denen Forscher und Ingenieure stehen, es Open Source mit einem kommerziellen Unternehmen daneben ausliefern und das Ökosystem die Designentscheidungen prüfen lassen. Für ai100, das Hunderte Audits gegen mehrere LLM-Engines ausführt, ist die Infrastrukturseite, die Stoicas Gruppe aufgebaut hat, kein Hintergrund — sie ist die Schicht, die bestimmt, wie machbar jede groß angelegte Modellvergleichsstudie überhaupt ist.

Lesenswert, wenn
man die Infrastrukturzwänge verstehen will, die prägen, was großskalige LLM-Evaluation tatsächlich leisten kann — jenseits des methodischen Framings.
Themen
verteilte ML-Systeme und Infrastruktur (Spark, Ray, vLLM); Ökonomie und Engineering großskaliger Modellbereitstellung; das Open-Source-plus-kommerzielles-Unternehmen-Muster in ML-Infrastruktur.
Zentrale Arbeiten
Apache Spark (2010, Mitentwickler); verteiltes Ray-Framework (2018, Co-Leitung); Beiträge zum vLLM-Efficient-Serving-Stack (2023, laufend).